GLM-5.3-Flash confirma a pista de Ox Alpha e aperta o cerco aos modelos de fronteira
GLM-5.3-Flash confirma a pista de Ox Alpha e aperta o cerco aos modelos de fronteira
Bom... parece que o enigmático Ox Alpha que apareceu no OpenRouter deixou de ser apenas uma pista. A confirmação chegou: tratava-se do GLM-5.3-Flash, o novo modelo de pesos abertos da Z.ai. É, portanto, a confirmação do que já se suspeitava em artigos anteriores: por trás do nome provisório estava uma nova versão da família GLM, com ambições muito superiores às de um simples modelo “Flash”.
O modelo combina 320 mil milhões de parâmetros totais com 18 mil milhões activos, através de uma arquitectura Mixture-of-Experts. A Z.ai apresenta-o como o primeiro modelo nativamente multimodal da série GLM-5 e introduz uma arquitectura híbrida de atenção esparsa e linear, desenhada para reduzir os custos de contexto longo. O modelo aceita texto, imagem e vídeo, e pode ser descarregado, afinado e executado por terceiros; isso não significa, contudo, que funcione num computador comum sem hardware especializado.
Apesar de resultados fortes, estes devem ser lidos com cuidado. A Z.ai afirma que o GLM-5.3-Flash supera o GLM-5.2 e se aproxima do Claude Opus 4.8 em testes de programação e tarefas agênticas. No OpenRouter, surge com 57,5 pontos no Artificial Analysis Intelligence Index, 71,5 no Coding Index e 58,2 no Agentic Index. Estes números são comparações úteis, mas não são uma prova de superioridade geral.. é que os benchmarks dependem de versões, instruções, ferramentas e configurações de avaliação.
Já o preço é um argumento difícil de ignorar. No OpenRouter, a tarifa listada é de 0,075 dólares por milhão de tokens de entrada, 0,25 dólares por milhão de tokens de saída e 0,015 dólares por milhão de tokens de entrada em cache. A janela de contexto anunciada chega a 1.310.720 tokens, embora o fornecedor principal indicado na plataforma limite actualmente o contexto a 1.048.576 tokens e a saída máxima a 131.072. A promessa de “um décimo do preço” face ao GLM-5.2 é uma afirmação da Z.ai, não uma medição independente.
A revelação muda o significado do episódio Ox Alpha. Não foi apenas um teste secreto de identidade: foi um sinal de que modelos chineses de pesos abertos já podem disputar tarefas de programação e agentes com sistemas fechados, a uma fracção do custo. A alegação de que o serviço atingiu 100 biliões de tokens por dia em chips exclusivamente chineses não foi confirmada por uma fonte primária acessível e, por isso, fica fora das conclusões deste artigo. O que está confirmado é mais sóbrio... e talvez mais importante: o GLM-5.3-Flash já está disponível para avaliação pública, com código, pesos e documentação para implementação independente.
Fontes: Hugging Face; OpenRouter; relatório técnico no arXiv; Z.ai.
