Grok 4.7: mais eficiente, mas ainda não é o líder absoluto
Grok 4.7: mais eficiente, mas ainda não é o líder absoluto
A SpaceXAI apresentou o Grok 4.7 como o seu modelo mais capaz para programação e trabalho de conhecimento. O lançamento aposta numa base maior, num treino de reforço mais longo e em tarefas que podem durar horas, mantendo o mesmo preço e velocidade do Grok 4.6.
Os dados disponíveis apontam para uma aproximação aos modelos de fronteira de outros laboratórios, mas infelizmente não para uma liderança universal. A Artificial Analysis atribui-lhe 46 pontos no seu Intelligence Index, mais dois do que ao Grok 4.6; no AA-Briefcase atingiu 1657 Elo e no GDPval-AA chegou aos 1695, resultados fortes em trabalho profissional prolongado, mas ainda atrás dos modelos de topo em algumas comparações.
A proposta económica é sim um ponto a favor: 2 dólares por milhão de tokens de entrada e 6 dólares de saída, com uma janela de contexto de 500 mil tokens e níveis de raciocínio entre low e xhigh. Está disponível na API, no Grok Build e no Cursor, enquanto a integração no GitHub Copilot decorre gradualmente. O preço por token, contudo, não conta toda a história: em testes independentes, o modo xhigh consumiu cerca de 81 mil tokens de saída por tarefa, contra 36 mil no Grok 4.6 e 27 mil no GPT-6 Astra. Pois.. temos de ter isso em conta também!
Na programação agentiva está o argumento mais forte para a actualização, pois o Grok 4.7 melhora nos testes de tarefas longas e, com o Grok Build, subiu para 56 pontos no Coding Agent Index da Artificial Analysis, contra 47 do antecessor. Claro que a comparação depende obviamente do agente e do nível de esforço usados, por isso estes resultados mostram progresso real, mas não provam que o modelo domine todos os fluxos de desenvolvimento.
A SpaceXAI diz também ter reforçado as salvaguardas contra jailbreaks e em áreas de uso dual, embora esses resultados devam ser lidos como declarações do próprio fornecedor (penso que não é preciso explicar mais). O Grok 4.7 parece uma escolha muito competitiva para quem precisa de agentes persistentes a baixo custo, MASSSSsss.... continua a ser prudente medi-lo no próprio código e calcular o custo por tarefa concluída, não apenas o preço da tabela.
