JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

Claude Opus 5.5: Um salto na eficiência

Claude Opus 5.5: Um salto na eficiência

Publicado em 23/09/2026 10:50 | Categorias: Artigos

Bom.. tenho que dizer que há de facto uma diferença entre o anúncio e a leitura mais entusiasta que circulou nas primeiras horas. A Anthropic lançou o Claude Opus 5.5 a 22 de setembro, como primeiro modelo da família Claude 5.5, apresentando-o com desempenho ao nível do Fable 5.1 na maioria do trabalho e com um custo operacional 40% inferior ao do Opus 5 em cargas típicas. O preço por token baixou 20%, para 4 dólares por milhão de tokens de entrada e 20 dólares de saída, enquanto as leituras de cache passaram para 0,20 dólares; Claro que a factura final continua a depender do esforço escolhido e do número de tokens usados... não há lanches gratis!

Os resultados publicados são fortes, mas não permitem dizer que o modelo ganhou em todas as áreas. O Opus 5.5 marcou 66,4% no Terminal-Bench 4.0 e 1846 Elo no GDPval-AA, liderando também a tabela apresentada para CursorBench, uso do computador e Humanity’s Last Exam com ferramentas. Porém, o GPT-6 Astra ficou à frente no AutomationBench, com 41,4% contra 40,0%, e no Terminal-Bench-Science, com 64,6% contra 58,7%. Os testes usam níveis de esforço e condições diferentes, pelo que apontam para uma vantagem relevante.. embora não seja uma medida absoluta de inteligência!

O que está melhor são os agentes de longa duração: programação, migrações extensas, auditorias e trabalho de conhecimento, etc. A documentação indica também uma janela de contexto de 1 milhão de tokens com saída máxima de 128 mil e pensamento adaptativo sempre ativo e controlado pelo nível de esforço. A escrita foi também afinada para colocar a informação importante no início e reduzir explicações difíceis de acompanhar. Existem também relatos de parceiros sobre tarefas que ocuparam horas e são promissores, mas continuam a ser casos de teste... por isso há que ler as coisas tendo isso em atenção!

Na segurança, a fotografia é mais complexa do que os slogans de lançamento. Numa avaliação específica, o modelo tentou contornar limites cerca de 85% menos vezes do que o Opus 5 ou o Mythos 5.1. O system card regista, contudo, uma fraqueza.. é que o modelo mostrou maior propensão para seguir instruções maliciosas inseridas em texto colado pelo utilizador. Já os acessos para biologia e cibersegurança inclui filtros e encaminhamentos para outros modelos...

O Opus 5.5 parece, por isso, um modelo de trabalho especialmente forte para código agentivo e tarefas profissionais longas, mas talvez não seja uma resposta definitiva à pergunta sobre qual é o melhor modelo. A vantagem claramente mais sólida está na relação entre qualidade, velocidade e custo por tarefa, sobretudo quando o nível de esforço é bem escolhido. Está disponível na API Claude e nos principais fornecedores de cloud da Anthropic. A decisão sensata é medi-lo no vosso próprio fluxo de trabalho, em vez de transformar os rankings num veredicto universal... 

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

Mistral Large 4: um modelo europeu de escala inédita, mas ainda em pré-visualização
Imagem gerada por I.A.

Mistral Large 4: um modelo europeu de escala inédita, mas ainda em pré-visualização

Publicado em 07/10/2026 11:58

A Mistral apresentou o Large 4, também apelidado de “Le Chonk”, um modelo de mistura de especialistas com cerca de...

Ler Mais
OpenAI divulga 722 manuscritos matemáticos gerados por IA
Imagem gerada por I.A.

OpenAI divulga 722 manuscritos matemáticos gerados por IA

Publicado em 07/10/2026 11:44

A OpenAI publicou 722 manuscritos matemáticos produzidos por um modelo interno ainda não disponibilizado ao público. A coleção, divulgada a...

Ler Mais
Quando agentes de IA entram em conflito, a coordenação falha
Imagem gerada por I.A.

Quando agentes de IA entram em conflito, a coordenação falha

Publicado em 06/10/2026 14:40

Juntar vários agentes de inteligência artificial não garante uma equipa mais eficaz. Num estudo publicado pela Anthropic, modelos receberam instruções...

Ler Mais
Agentes de IA: a velocidade não substitui a verificação
Imagem gerada por I.A.

Agentes de IA: a velocidade não substitui a verificação

Publicado em 06/10/2026 14:34

Os agentes de programação já conseguem assumir tarefas longas em bases de código reais: planeiam alterações, distribuem trabalho por agentes...

Ler Mais
Modelos em teste, agentes em expansão e um alerta de privacidade
Imagem gerada por I.A.

Modelos em teste, agentes em expansão e um alerta de privacidade

Publicado em 28/09/2026 16:46

O mercado da inteligência artificial voltou a misturar lançamentos concretos com rumores de modelos ainda em avaliação. A Google confirmou...

Ler Mais
Space Bunny Alpha: um modelo rápido, mas ainda sem identidade
Imagem gerada por I.A.

Space Bunny Alpha: um modelo rápido, mas ainda sem identidade

Publicado em 28/09/2026 16:45

O Space Bunny Alpha surgiu no OpenRouter como um modelo “stealth”: o fornecedor mantém a identidade e os detalhes técnicos...

Ler Mais
Xiaomi MiMo-V2.6: modelos abertos com ambição multimodal
Imagem gerada por I.A.

Xiaomi MiMo-V2.6: modelos abertos com ambição multimodal

Publicado em 28/09/2026 16:30

A Xiaomi lançou a família MiMo-V2.6, composta pelos modelos Pro e Flash, com pesos abertos e capacidades multimodais. Ambos aceitam...

Ler Mais
Grok 4.7: mais eficiente, mas ainda não é o líder absoluto
Imagem gerada por I.A.

Grok 4.7: mais eficiente, mas ainda não é o líder absoluto

Publicado em 23/09/2026 11:00

A SpaceXAI apresentou o Grok 4.7 como o seu modelo mais capaz para programação e trabalho de conhecimento. O lançamento...

Ler Mais

Abaixo encontra uma pequena lista de artigos relacionados com este tema..