JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

Hy3: o modelo Mixture-of-Experts de 295B da Tencent que rivaliza com gigantes open-source

Hy3: o modelo Mixture-of-Experts de 295B da Tencent que rivaliza com gigantes open-source

Publicado em 13/07/2026 12:45 | Categorias: Artigos

A Tencent apresentou o Hy3, um modelo de linguagem Mixture-of-Experts (MoE) com 295 mil milhões de parâmetros totais e 21 mil milhões activados por token, desenvolvido pela equipa Tencent Hy. Trata-se da evolução do Hy3 Preview, lançado no final de abril, a partir do qual a empresa recolheu feedback de mais de 50 produtos e escalou o pós-treino com dados de maior qualidade, apresentando agora um modelo que supera modelos de tamanho equivalente e rivaliza com modelos open-source de topo com dois a cinco vezes mais parâmetros.

Do ponto de vista arquitectural, o Hy3 é um modelo MoE com 192 especialistas, dos quais apenas oito são activados por token, organizados em 80 camadas com atenção do tipo GQA (64 cabeças, oito cabeças KV). O contexto nativo estende-se a 256 mil tokens e a arquitectura inclui ainda uma camada MTP (Multi-Token Prediction) de 3,8 mil milhões de parâmetros, usada para descodificação especulativa e que acelera a geração mantendo a coerência do raciocínio.

Construído sobre o Hy3 Preview, o modelo reforça a qualidade e a diversidade dos dados de pós-treino e escala o treino por reforço (RL), obtendo ganhos sólidos em tarefas de raciocínio, agente e contexto longo, posicionando-se como competitivo face a modelos flagship substancialmente maiores. A aposta da Tencent passa por oferecer uma alternativa de código aberto com forte relação custo-eficácia para cenários de produção.

Para além dos benchmarks públicos, a equipa realizou uma avaliação cega com 270 peritos que usaram tarefas reais do seu trabalho, na qual o Hy3 obteve 2,67 em 4, superando o GLM-5.1, que ficou pelos 2,51 em 4. A vantagem foi mais acentuada em desenvolvimento frontend, dados e armazenamento e tarefas de CI/CD, áreas em que a utilidade prática do modelo se revela superior.

Na dimensão de agente, o Hy3 corrigiu múltiplos problemas de base na fiabilidade de chamadas de ferramentas e formatos de saída, elevando o modelo a um padrão de nível de produção em diferentes configurações de ferramentas e restrições de saída. A recuperação de erros em chamadas de ferramentas e a eficiência global melhoraram, e o modelo generaliza entre diversos andaimes (scaffoldings) de agente.

Essa robustez traduz-se em variância reduzida de precisão: no SWE-Bench Verified, a diferença de accuracy entre andaimes como CodeBuddy, Cline e KiloCode mantém-se abaixo de 4%, um sinal de estabilidade independentemente do enquadramento de execução. É um requisito essencial para que equipas possam integrar o modelo em pipelines de código reais sem surpresas.

No combate à alucinação, a equipa adoptou o princípio de "responder quando há fundamentação, declarar quando faltam provas, não confundir fontes nem fabricar dados", implementando limpezas de dados e restrições de treino granulares. Em avaliações internas baseadas em cenários reais, a taxa de alucinação caiu de 12,5% para 5,4% e os erros de senso comum diminuíram de 25,4% para 12,7%, reduzindo materialmente a confusão de factos, a invenção de dados e contradições lógicas.

A retenção de contexto complexo e o acompanhamento de intenção em múltiplos turnos também melhoraram através de optimização conjunta de SFT e RL, com ganhos em resolução de correferência, recuperação de elipses e herança de restrições ao longo da conversa. Em testes internos abrangentes de múltiplos turnos, a taxa de problemas desceu de 17,4% para 7,9%, com progresso visível também em avaliações de diálogo longo como o MRCR.

Em cenários de produtividade (programação, trabalho de escritório, modelação financeira, desenho frontend e desenvolvimento de jogos) o Hy3 regista avanços notáveis e apresenta-se como uma opção de modelo fiável e económica. A utilidade reportada estende-se a tarefas práticas de negócio e criativas, não ficando confinada a resultados de laboratório.

Ao contrário do Hy3 Preview, que foi disponibilizado sob a Tencent Hy Community License Agreement, a versão Hy3 é lançada sob a licença Apache 2.0, alargando significativamente a liberdade de uso comercial e de integração. O modelo e a sua variante quantizada Hy3-FP8 estão disponíveis no Hugging Face, ModelScope, GitCode e CNB, acompanhados de um pipeline completo de fine-tuning (full e LoRA) e da ferramenta de compressão AngelSlim.

Para implantação, a Tencent recomenda servir o Hy3 com vLLM ou SGLang em oito GPUs (por exemplo H20-3e ou GPUs com memória superior), com suporte dedicado a MTP para descodificação especulativa e aos parsers de ferramenta e raciocínio hy_v3. Os parâmetros recomendados são temperature 0,9 e top_p 1,0, com um modo de raciocínio (reasoning_effort) que pode ser ajustado entre "high" para tarefas complexas e "no_think" para respostas directas.

O Hy3 ilustra a rápida convergência do ecossistema open-source chinês em torno de modelos MoE de grande escala mas activação eficiente, capazes de rivalizar com pesos fechados muito maiores a uma fração do custo de inferência. Combinando licença permissiva, pipeline de treino aberto e forte desempenho em agentes, o modelo reforça a posição da Tencent como um dos principais fornecedores de fundamentos de IA acessíveis.

Se quiser saber mais, por favor visite : https://hy.tencent.com/research/hy3

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

Ontology Engineering: o futuro prometido da IA que ainda tem de provar o seu valor
Imagem gerada por I.A.

Ontology Engineering: o futuro prometido da IA que ainda tem de provar o seu valor

Publicado em 25/08/2026 18:56

No levantamento sobre engenharia de grafos publicado em Agosto de 2026, abordado no artigo anterior, os investigadores dedicam uma das...

Ler Mais
Graph Engineering: a engenharia de grafos como novo paradigma dos agentes LLM
Imagem gerada por I.A.

Graph Engineering: a engenharia de grafos como novo paradigma dos agentes LLM

Publicado em 25/08/2026 18:35

Uma equipa alargada de investigadores, com nomes ligados à University of Illinois Urbana-Champaign e à Sichuan University, publicou em Agosto...

Ler Mais
Intismeran e melanoma: o avanço da vacina de mRNA que exige entusiasmo com método
Imagem gerada por I.A.

Intismeran e melanoma: o avanço da vacina de mRNA que exige entusiasmo com método

Publicado em 23/08/2026 20:00

Alegadamente... há uma boa notícia na investigação do cancro, mas não estamos perante uma “cura descoberta por inteligência artificial”.. não...

Ler Mais
OpenAI abranda trabalho em Astra: segurança cibernética não confirma um “GPT-6 adiado”
Imagem gerada por I.A.

OpenAI abranda trabalho em Astra: segurança cibernética não confirma um “GPT-6 adiado”

Publicado em 23/08/2026 16:40

A OpenAI confirmou que abrandou temporariamente o desenvolvimento de modelos de fronteira enquanto reforça medidas de segurança relacionadas com capacidades...

Ler Mais
Ox Alpha: o que se sabe sobre o modelo anónimo — e o que continua a ser rumor
Imagem gerada por I.A.

Ox Alpha: o que se sabe sobre o modelo anónimo — e o que continua a ser rumor

Publicado em 23/08/2026 14:30

É... o Ox Alpha apareceu como um modelo anónimo em plataformas usadas por programadores e depressa gerou o habitual frenesim...

Ler Mais
Claude Academy: formação gratuita que começa pelaquilo que os modelos não sabem fazer
Imagem gerada por I.A.

Claude Academy: formação gratuita que começa pelaquilo que os modelos não sabem fazer

Publicado em 23/08/2026 12:15

A Claude Academy é a plataforma de aprendizagem da Anthropic para quem quer usar os seus produtos com mais método....

Ler Mais
Ornith-1.5: o modelo que cria o próprio currículo, mas ainda tem de provar serviço
Imagem gerada por I.A.

Ornith-1.5: o modelo que cria o próprio currículo, mas ainda tem de provar serviço

Publicado em 23/08/2026 12:00

O Ornith-1.5 chega com uma promessa que merece alguma atenção (ou muita), pois em vez de depender apenas de tarefas...

Ler Mais
GEN 1.5
Créditos de imagem : generalistai.com
Link Externo

GEN 1.5

Publicado em 23/08/2026 11:15

GEN-1.5 é um modelo fundacional para robótica capaz de aprender novas tarefas físicas em segundos a partir de uma única demonstração, sem treino adicional, além de generalizar, improvisar e utilizar ferramentas nunca vistas.

Visitar Link

Abaixo encontra uma pequena lista de artigos relacionados com este tema..