Em tarefas científicas, o GPT-6.1 Sol mais que dobrou a pontuação do antecessor, enquanto o custo médio por execução permaneceu muito abaixo daquele registrado pelo Astra.
A OpenAI apresentou o GPT-6.1 Sol com melhorias voltadas a agentes capazes de programar, operar computadores e concluir fluxos profissionais complexos que exigem várias etapas de execução. A atualização também amplia o desempenho em documentos extensos, tarefas científicas e uso coordenado de ferramentas, enquanto o GPT-6 Astra permanece como a opção mais avançada da família.
GPT-6.1 Sol amplia autonomia em tarefas complexas
O avanço mais relevante aparece em atividades nas quais o modelo precisa interpretar interfaces, tomar decisões intermediárias e concluir sequências de trabalho sem depender apenas da geração de respostas textuais.
No OSWorld 2.0, avaliação voltada ao uso autônomo de computadores, o GPT-6.1 Sol superou o GPT-6 Sol em sete pontos percentuais na configuração de esforço máximo.
Essa evolução também apareceu em fluxos corporativos compostos por diversas etapas, avaliados pelo AutomationBench, no qual a nova versão ficou 4,8 pontos percentuais acima do modelo anterior sob parâmetros equivalentes.
Nas condições apresentadas pela OpenAI, o resultado também colocou o GPT-6.1 Sol acima do Opus 5.5 quando ambos foram avaliados com esforço médio.
Na engenharia de software, o DeepSWE 1.1 mostrou uma melhora de 6,4 pontos percentuais em relação ao GPT-6 Sol, com desempenho equivalente ao Astra na configuração utilizada pela avaliação.
Esse avanço reforça a proposta de aplicar o modelo em tarefas nas quais agentes precisam interpretar código, planejar alterações e executar diferentes ações de forma coordenada.
Os ganhos também alcançaram trabalhos profissionais baseados em PDFs complexos, nos quais o GPT-6.1 Sol se aproximou do Astra e superou o Opus 5.5 com mecanismos de contingência ativados.
A melhora amplia o uso do modelo em atividades que exigem leitura aprofundada, combinação de informações e produção de resultados a partir de documentos extensos.
Ciência, precisão e controles também avançam
Em avaliações científicas que reuniram análise de dados, simulações e demonstrações de teoremas, o GPT-6.1 Sol mais que dobrou a pontuação obtida pelo modelo anterior na configuração de esforço máximo.
O GPT-6 Astra continuou na liderança dos testes científicos mais difíceis, com 68,1%, o que preserva uma diferença relevante nas tarefas de maior exigência técnica.
A nova versão também apresentou uma pequena melhora em precisão factual, com 4,1% das respostas contendo algum erro dentro de uma avaliação criada para apresentar alto nível de dificuldade.
O GPT-6 Sol registrou 4,5% no mesmo teste, enquanto o Astra alcançou taxa de 4%, resultado ligeiramente melhor do que o novo modelo.
Outro avanço apareceu no comportamento diante de falhas de ferramentas e restrições estabelecidas pelo usuário, aspecto importante para sistemas que executam ações sem supervisão contínua.
Em um teste sobre problemas em sistemas de busca, o GPT-6.1 Sol deixou de informar a falha em 2,1% dos casos, contra 4,9% registrados pela versão anterior.
Esses resultados acompanham melhorias na capacidade de respeitar limites de ação, comunicar problemas técnicos e evitar operações que não tenham sido autorizadas durante a execução das tarefas.
Esse tipo de controle ganha importância conforme modelos passam a assumir processos profissionais mais longos, nos quais uma falha intermediária pode comprometer todo o resultado final.
OpenAI amplia disponibilidade e opções de velocidade
O GPT-6.1 Sol está disponível pela API e também chegou ao ChatGPT Work e ao Codex para usuários dos planos Plus, Pro, Business, Enterprise e Edu.
De acordo com o material apresentado pela OpenAI, o modelo ainda não estava disponível diretamente no Chat no momento em que a atualização foi anunciada.
Na API, a OpenAI definiu preços de US$ 2 por milhão de tokens de entrada, US$ 10 por milhão de tokens de saída e US$ 0,10 por milhão de tokens armazenados em cache.
Em diferentes avaliações, essa estrutura permitiu ao GPT-6.1 Sol se aproximar do Astra em desempenho com uma diferença expressiva de custo por tarefa.
No OSWorld 2.0, por exemplo, o GPT-6.1 Sol ficou apenas 2,1 pontos percentuais abaixo do Astra, com custo equivalente a aproximadamente um sétimo daquele registrado pelo modelo mais avançado.
Em engenharia de software, o desempenho equivalente ao Astra apareceu com uma despesa próxima de um quinto, segundo os testes apresentados pela companhia.
A OpenAI também apresentou versões Ultrafast do GPT-6.1 Sol e do GPT-6 Astra, com velocidade que pode alcançar até oito vezes aquela observada no Astra padrão.
Essas variantes foram disponibilizadas pela API, pelo ChatGPT Work e pelo Codex dentro de uma nova modalidade Pro anunciada por US$ 500 mensais.
