Claude Opus 5.5: Um salto na eficiência
Claude Opus 5.5: Um salto na eficiência
Bom.. tenho que dizer que há de facto uma diferença entre o anúncio e a leitura mais entusiasta que circulou nas primeiras horas. A Anthropic lançou o Claude Opus 5.5 a 22 de setembro, como primeiro modelo da família Claude 5.5, apresentando-o com desempenho ao nível do Fable 5.1 na maioria do trabalho e com um custo operacional 40% inferior ao do Opus 5 em cargas típicas. O preço por token baixou 20%, para 4 dólares por milhão de tokens de entrada e 20 dólares de saída, enquanto as leituras de cache passaram para 0,20 dólares; Claro que a factura final continua a depender do esforço escolhido e do número de tokens usados... não há lanches gratis!
Os resultados publicados são fortes, mas não permitem dizer que o modelo ganhou em todas as áreas. O Opus 5.5 marcou 66,4% no Terminal-Bench 4.0 e 1846 Elo no GDPval-AA, liderando também a tabela apresentada para CursorBench, uso do computador e Humanity’s Last Exam com ferramentas. Porém, o GPT-6 Astra ficou à frente no AutomationBench, com 41,4% contra 40,0%, e no Terminal-Bench-Science, com 64,6% contra 58,7%. Os testes usam níveis de esforço e condições diferentes, pelo que apontam para uma vantagem relevante.. embora não seja uma medida absoluta de inteligência!
O que está melhor são os agentes de longa duração: programação, migrações extensas, auditorias e trabalho de conhecimento, etc. A documentação indica também uma janela de contexto de 1 milhão de tokens com saída máxima de 128 mil e pensamento adaptativo sempre ativo e controlado pelo nível de esforço. A escrita foi também afinada para colocar a informação importante no início e reduzir explicações difíceis de acompanhar. Existem também relatos de parceiros sobre tarefas que ocuparam horas e são promissores, mas continuam a ser casos de teste... por isso há que ler as coisas tendo isso em atenção!
Na segurança, a fotografia é mais complexa do que os slogans de lançamento. Numa avaliação específica, o modelo tentou contornar limites cerca de 85% menos vezes do que o Opus 5 ou o Mythos 5.1. O system card regista, contudo, uma fraqueza.. é que o modelo mostrou maior propensão para seguir instruções maliciosas inseridas em texto colado pelo utilizador. Já os acessos para biologia e cibersegurança inclui filtros e encaminhamentos para outros modelos...
O Opus 5.5 parece, por isso, um modelo de trabalho especialmente forte para código agentivo e tarefas profissionais longas, mas talvez não seja uma resposta definitiva à pergunta sobre qual é o melhor modelo. A vantagem claramente mais sólida está na relação entre qualidade, velocidade e custo por tarefa, sobretudo quando o nível de esforço é bem escolhido. Está disponível na API Claude e nos principais fornecedores de cloud da Anthropic. A decisão sensata é medi-lo no vosso próprio fluxo de trabalho, em vez de transformar os rankings num veredicto universal...
