JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

Hy3: o modelo Mixture-of-Experts de 295B da Tencent que rivaliza com gigantes open-source

Hy3: o modelo Mixture-of-Experts de 295B da Tencent que rivaliza com gigantes open-source
Imagem gerada por I.A.

Hy3: o modelo Mixture-of-Experts de 295B da Tencent que rivaliza com gigantes open-source

Publicado em 13/07/2026 12:45 | Categorias: Artigos

A Tencent apresentou o Hy3, um modelo de linguagem Mixture-of-Experts (MoE) com 295 mil milhões de parâmetros totais e 21 mil milhões activados por token, desenvolvido pela equipa Tencent Hy. Trata-se da evolução do Hy3 Preview, lançado no final de abril, a partir do qual a empresa recolheu feedback de mais de 50 produtos e escalou o pós-treino com dados de maior qualidade, apresentando agora um modelo que supera modelos de tamanho equivalente e rivaliza com modelos open-source de topo com dois a cinco vezes mais parâmetros.

Do ponto de vista arquitectural, o Hy3 é um modelo MoE com 192 especialistas, dos quais apenas oito são activados por token, organizados em 80 camadas com atenção do tipo GQA (64 cabeças, oito cabeças KV). O contexto nativo estende-se a 256 mil tokens e a arquitectura inclui ainda uma camada MTP (Multi-Token Prediction) de 3,8 mil milhões de parâmetros, usada para descodificação especulativa e que acelera a geração mantendo a coerência do raciocínio.

Construído sobre o Hy3 Preview, o modelo reforça a qualidade e a diversidade dos dados de pós-treino e escala o treino por reforço (RL), obtendo ganhos sólidos em tarefas de raciocínio, agente e contexto longo, posicionando-se como competitivo face a modelos flagship substancialmente maiores. A aposta da Tencent passa por oferecer uma alternativa de código aberto com forte relação custo-eficácia para cenários de produção.

Para além dos benchmarks públicos, a equipa realizou uma avaliação cega com 270 peritos que usaram tarefas reais do seu trabalho, na qual o Hy3 obteve 2,67 em 4, superando o GLM-5.1, que ficou pelos 2,51 em 4. A vantagem foi mais acentuada em desenvolvimento frontend, dados e armazenamento e tarefas de CI/CD, áreas em que a utilidade prática do modelo se revela superior.

Na dimensão de agente, o Hy3 corrigiu múltiplos problemas de base na fiabilidade de chamadas de ferramentas e formatos de saída, elevando o modelo a um padrão de nível de produção em diferentes configurações de ferramentas e restrições de saída. A recuperação de erros em chamadas de ferramentas e a eficiência global melhoraram, e o modelo generaliza entre diversos andaimes (scaffoldings) de agente.

Essa robustez traduz-se em variância reduzida de precisão: no SWE-Bench Verified, a diferença de accuracy entre andaimes como CodeBuddy, Cline e KiloCode mantém-se abaixo de 4%, um sinal de estabilidade independentemente do enquadramento de execução. É um requisito essencial para que equipas possam integrar o modelo em pipelines de código reais sem surpresas.

No combate à alucinação, a equipa adoptou o princípio de "responder quando há fundamentação, declarar quando faltam provas, não confundir fontes nem fabricar dados", implementando limpezas de dados e restrições de treino granulares. Em avaliações internas baseadas em cenários reais, a taxa de alucinação caiu de 12,5% para 5,4% e os erros de senso comum diminuíram de 25,4% para 12,7%, reduzindo materialmente a confusão de factos, a invenção de dados e contradições lógicas.

A retenção de contexto complexo e o acompanhamento de intenção em múltiplos turnos também melhoraram através de optimização conjunta de SFT e RL, com ganhos em resolução de correferência, recuperação de elipses e herança de restrições ao longo da conversa. Em testes internos abrangentes de múltiplos turnos, a taxa de problemas desceu de 17,4% para 7,9%, com progresso visível também em avaliações de diálogo longo como o MRCR.

Em cenários de produtividade (programação, trabalho de escritório, modelação financeira, desenho frontend e desenvolvimento de jogos) o Hy3 regista avanços notáveis e apresenta-se como uma opção de modelo fiável e económica. A utilidade reportada estende-se a tarefas práticas de negócio e criativas, não ficando confinada a resultados de laboratório.

Ao contrário do Hy3 Preview, que foi disponibilizado sob a Tencent Hy Community License Agreement, a versão Hy3 é lançada sob a licença Apache 2.0, alargando significativamente a liberdade de uso comercial e de integração. O modelo e a sua variante quantizada Hy3-FP8 estão disponíveis no Hugging Face, ModelScope, GitCode e CNB, acompanhados de um pipeline completo de fine-tuning (full e LoRA) e da ferramenta de compressão AngelSlim.

Para implantação, a Tencent recomenda servir o Hy3 com vLLM ou SGLang em oito GPUs (por exemplo H20-3e ou GPUs com memória superior), com suporte dedicado a MTP para descodificação especulativa e aos parsers de ferramenta e raciocínio hy_v3. Os parâmetros recomendados são temperature 0,9 e top_p 1,0, com um modo de raciocínio (reasoning_effort) que pode ser ajustado entre "high" para tarefas complexas e "no_think" para respostas directas.

O Hy3 ilustra a rápida convergência do ecossistema open-source chinês em torno de modelos MoE de grande escala mas activação eficiente, capazes de rivalizar com pesos fechados muito maiores a uma fração do custo de inferência. Combinando licença permissiva, pipeline de treino aberto e forte desempenho em agentes, o modelo reforça a posição da Tencent como um dos principais fornecedores de fundamentos de IA acessíveis.

Se quiser saber mais, por favor visite : https://hy.tencent.com/research/hy3