OpenAI lança GPT-6.1 Sol com melhorias para agentes de IA

Em tarefas científicas, o GPT-6.1 Sol mais que dobrou a pontuação do antecessor, enquanto o custo médio por execução permaneceu muito abaixo daquele registrado pelo Astra.

A OpenAI apresentou o GPT-6.1 Sol com melhorias voltadas a agentes capazes de programar, operar computadores e concluir fluxos profissionais complexos que exigem várias etapas de execução. A atualização também amplia o desempenho em documentos extensos, tarefas científicas e uso coordenado de ferramentas, enquanto o GPT-6 Astra permanece como a opção mais avançada da família.

GPT-6.1 Sol amplia autonomia em tarefas complexas

O avanço mais relevante aparece em atividades nas quais o modelo precisa interpretar interfaces, tomar decisões intermediárias e concluir sequências de trabalho sem depender apenas da geração de respostas textuais.

No OSWorld 2.0, avaliação voltada ao uso autônomo de computadores, o GPT-6.1 Sol superou o GPT-6 Sol em sete pontos percentuais na configuração de esforço máximo.

Essa evolução também apareceu em fluxos corporativos compostos por diversas etapas, avaliados pelo AutomationBench, no qual a nova versão ficou 4,8 pontos percentuais acima do modelo anterior sob parâmetros equivalentes.

Nas condições apresentadas pela OpenAI, o resultado também colocou o GPT-6.1 Sol acima do Opus 5.5 quando ambos foram avaliados com esforço médio.

Na engenharia de software, o DeepSWE 1.1 mostrou uma melhora de 6,4 pontos percentuais em relação ao GPT-6 Sol, com desempenho equivalente ao Astra na configuração utilizada pela avaliação.

Esse avanço reforça a proposta de aplicar o modelo em tarefas nas quais agentes precisam interpretar código, planejar alterações e executar diferentes ações de forma coordenada.

Os ganhos também alcançaram trabalhos profissionais baseados em PDFs complexos, nos quais o GPT-6.1 Sol se aproximou do Astra e superou o Opus 5.5 com mecanismos de contingência ativados.

A melhora amplia o uso do modelo em atividades que exigem leitura aprofundada, combinação de informações e produção de resultados a partir de documentos extensos.

Ciência, precisão e controles também avançam

Em avaliações científicas que reuniram análise de dados, simulações e demonstrações de teoremas, o GPT-6.1 Sol mais que dobrou a pontuação obtida pelo modelo anterior na configuração de esforço máximo.

O GPT-6 Astra continuou na liderança dos testes científicos mais difíceis, com 68,1%, o que preserva uma diferença relevante nas tarefas de maior exigência técnica.

A nova versão também apresentou uma pequena melhora em precisão factual, com 4,1% das respostas contendo algum erro dentro de uma avaliação criada para apresentar alto nível de dificuldade.

O GPT-6 Sol registrou 4,5% no mesmo teste, enquanto o Astra alcançou taxa de 4%, resultado ligeiramente melhor do que o novo modelo.

Outro avanço apareceu no comportamento diante de falhas de ferramentas e restrições estabelecidas pelo usuário, aspecto importante para sistemas que executam ações sem supervisão contínua.

Em um teste sobre problemas em sistemas de busca, o GPT-6.1 Sol deixou de informar a falha em 2,1% dos casos, contra 4,9% registrados pela versão anterior.

Esses resultados acompanham melhorias na capacidade de respeitar limites de ação, comunicar problemas técnicos e evitar operações que não tenham sido autorizadas durante a execução das tarefas.

Esse tipo de controle ganha importância conforme modelos passam a assumir processos profissionais mais longos, nos quais uma falha intermediária pode comprometer todo o resultado final.

OpenAI amplia disponibilidade e opções de velocidade

O GPT-6.1 Sol está disponível pela API e também chegou ao ChatGPT Work e ao Codex para usuários dos planos Plus, Pro, Business, Enterprise e Edu.

De acordo com o material apresentado pela OpenAI, o modelo ainda não estava disponível diretamente no Chat no momento em que a atualização foi anunciada.

Na API, a OpenAI definiu preços de US$ 2 por milhão de tokens de entrada, US$ 10 por milhão de tokens de saída e US$ 0,10 por milhão de tokens armazenados em cache.

Em diferentes avaliações, essa estrutura permitiu ao GPT-6.1 Sol se aproximar do Astra em desempenho com uma diferença expressiva de custo por tarefa.

No OSWorld 2.0, por exemplo, o GPT-6.1 Sol ficou apenas 2,1 pontos percentuais abaixo do Astra, com custo equivalente a aproximadamente um sétimo daquele registrado pelo modelo mais avançado.

Em engenharia de software, o desempenho equivalente ao Astra apareceu com uma despesa próxima de um quinto, segundo os testes apresentados pela companhia.

A OpenAI também apresentou versões Ultrafast do GPT-6.1 Sol e do GPT-6 Astra, com velocidade que pode alcançar até oito vezes aquela observada no Astra padrão.

Essas variantes foram disponibilizadas pela API, pelo ChatGPT Work e pelo Codex dentro de uma nova modalidade Pro anunciada por US$ 500 mensais.

↑
Exit mobile version