A Anthropic afirma que o Claude Sonnet 5.5 alcançou 70,6% no Terminal-Bench 4.0, resultado muito acima dos 10,3% registrados pela geração anterior.
A Anthropic apresentou o Claude Sonnet 5.5 como uma evolução voltada a tarefas cotidianas, programação, produção de documentos e atividades profissionais que exigem respostas rápidas e uso eficiente de ferramentas. O novo modelo supera o Sonnet 5 em diferentes avaliações, aproxima-se do Opus 5.5 em alguns cenários e acrescenta proteções específicas diante do avanço de suas capacidades em cibersegurança.
Claude Sonnet 5.5 amplia desempenho em programação
O salto mais expressivo aparece em programação agentiva, área na qual o Claude Sonnet 5.5 alcançou 70,6% no Terminal-Bench 4.0, diante dos 10,3% registrados pela geração anterior.
Essa diferença indica uma mudança relevante na capacidade de executar sequências de ações em ambientes de terminal, principalmente em tarefas que exigem maior autonomia e combinação de diferentes etapas técnicas.
O avanço também aparece no FrontierCode, teste em que o novo Sonnet superou seu antecessor e, sob determinados níveis de esforço computacional, aproximou-se do desempenho apresentado pelo Opus 5.5.
No CursorBench 4.0, a melhor pontuação obtida pelo modelo ficou cerca de dois pontos abaixo do resultado alcançado pelo produto mais avançado da Anthropic.
Além das avaliações formais, a empresa afirma que o modelo utiliza ferramentas com maior eficiência e conclui atividades com menos etapas do que o Sonnet 5.
Essa característica reduz a quantidade de tokens necessária para determinadas tarefas e reforça a proposta de entregar respostas mais rápidas sem depender sempre de modelos mais pesados.
Segundo a Anthropic, a velocidade de geração ficou mais de 30% acima daquela observada no Sonnet 5, resultado que coloca esta versão como o Sonnet mais rápido já lançado pela companhia.
Para desenvolvedores, essa combinação entre rapidez e uso mais econômico de recursos pode favorecer rotinas repetitivas, correções de código e fluxos automatizados com alto volume de solicitações.
Documentos e interfaces ganham mais espaço
Os ganhos não ficaram restritos à programação, pois o Claude Sonnet 5.5 também apresentou avanço em tarefas relacionadas a análise, produção de conteúdo profissional e criação de materiais visuais.
No GDPval-AA, voltado a trabalho de conhecimento, o desempenho ficou próximo ao Opus 5.5 e acima daquele registrado pelo Sonnet 5.
Testadores iniciais também relataram respostas mais naturais em conversas e maior eficiência para criar interfaces, apresentações, planilhas e outros materiais utilizados em ambientes corporativos.
Essa combinação reforça o posicionamento do modelo como uma alternativa para atividades bem definidas que não exigem necessariamente o nível máximo de capacidade oferecido pela linha Opus.
Em uma avaliação interna apresentada pela Anthropic, o modelo recebeu informações financeiras de uma empresa e um modelo prévio de apresentação antes de elaborar dez slides.
Dois especialistas que analisaram o resultado classificaram a primeira versão como adequada para envio, segundo o relato divulgado pela companhia.
Esse tipo de tarefa ajuda a mostrar onde a empresa pretende diferenciar o Sonnet 5.5 dentro do portfólio, com foco em trabalhos que combinam texto, organização de informações e produção visual.
A proposta também inclui correções de código e atividades documentais nas quais velocidade e consistência podem ser mais importantes do que o uso permanente do modelo mais avançado disponível.
Segurança acompanha expansão das capacidades
O crescimento do desempenho técnico levou a Anthropic a aplicar ao Sonnet 5.5 proteções cibernéticas semelhantes às adotadas nos modelos mais avançados da companhia.
Trata-se do primeiro integrante da linha Sonnet lançado com esse nível de salvaguardas, mudança associada ao aumento das capacidades observadas em tarefas ligadas à segurança digital.
Nas avaliações internas citadas pela empresa, o modelo apresentou resultados iguais ou superiores aos do Sonnet 5 na maior parte dos testes relacionados a alinhamento, honestidade e resistência a usos indevidos.
A Anthropic também adicionou mecanismos voltados a ataques de destilação, prática que procura extrair capacidades por meio de grande volume de interações distribuídas entre milhares de contas falsas.
O Claude Sonnet 5.5 já pode ser utilizado nas plataformas da própria Anthropic e também por serviços da Amazon Web Services, Google Cloud e Microsoft Azure.
Na Claude Platform, desenvolvedores encontram o modelo pelo identificador claude-sonnet-5-5 e podem utilizar uma configuração que prevê retenção zero de dados.
Embora os valores nominais de entrada e saída permaneçam iguais aos do Sonnet 5, a Anthropic afirma que a maior eficiência pode reduzir em até 30% o custo necessário para concluir determinadas tarefas.
Esse aspecto aparece como consequência do menor consumo de tokens, mas o principal argumento do lançamento está no avanço simultâneo de velocidade, programação, trabalho profissional e uso de ferramentas.
