JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

DiffusionGemma: geração paralela de texto em bloco e porquê de já ser relevante

DiffusionGemma: geração paralela de texto em bloco e porquê de já ser relevante

Publicado em 11/06/2026 17:00 | Categorias: Artigos

A Google lançou um modelo aberto que altera a abordagem à geração de texto. O DiffusionGemma, disponibilizado a 10 de junho de 2026 sob licença Apache 2.0, parte da família Gemma 4 e demonstra que a inferência pode deixar de ser um encadeamento estritamente sequencial.

Em vez de prever um token de cada vez (como fazem quase todos os modelos de linguagem actuais) este modelo gera blocos inteiros de texto em simultâneo e refina-os em passes iterativas. A diferença não é só de engenharia: traduz-se directamente em velocidade de serviço.

A arquitectura mantém a herança Gemma 4: um MoE com 26 mil milhões de parâmetros, dos quais apenas 3,8 mil milhões são activos por token. Mantém-se a janela de contexto de 256 mil tokens, bem como a multimodalidade, aceitando texto, imagem e vídeo como entrada. O que muda é o processo de geração. O modelo começa por um "canvas" com 256 tokens aleatórios, semelhante ao ruído inicial numa imagem gerada por difusão. Em cada passo, percorre todo esse canvas em paralelo, trancando os tokens com maior confiança e reconduzindo os restantes até que o bloco se estabilize.

Essa abordagem paralela resolve um problema concreto do hardware local: a largura de banda de memória. Num autogerador causal, a GPU tem de recarregar os pesos para cada token gerado, pelo que grande parte do chip fica em espera. Ao operar sobre um bloco completo, a carga paralela ocupa os tensor cores que, no caso de inferência para um só utilizador, estariam subaproveitados.

O resultado é uma taxa medida superior a 1000 tokens por segundo num H100 e acima de 700 tokens por segundo numa RTX 5090. O segundo número é o mais relevante para o mercado actual, pois refere-se a uma placa que existe em larga escala nos consumidores finais. Mas isto não é um ganho gratuito: há uma troca clara entre velocidade e qualidade. Nos benchmarks analisados, o DiffusionGemma fica entre 5 e 19 pontos abaixo do Gemma 4 26B padrão. MMLU Pro passa de 82,6% para 77,6%, AIME 2026 de 88,3% para 69,1%, LiveCodeBench de 77,1% para 69,1% e GPQA Diamond de 82,3% para 73,2%. O único teste onde vence é o Humanity's Last Exam sem ferramentas, com 11% contra 8,7%.

Essa diferença justifica que a Google classifique o modelo como experimental e recomende o Gemma 4 26B convencional a quem precise de qualidade máxima. A aceleração também tem limites funcionais: em servidores de cloud muito solicitados, os autogeradores beneficiam de batchs grandes e ocupam melhor o hardware; aqui o ganho diminui e pode até tornar o serviço mais caro.

Além disso, arquitecturas de memória unificada como o Apple Silicon, onde o factor limitador é a própria largura de banda, não tiram o mesmo proveito. O alvo declarado é um utilizador com GPU dedicada, local, em operação de baixa concorrência.

As características mais interessantes vão para além da velocidade. Dentro de cada bloco, a atenção é bidirecional: todos os tokens se podem ver uns aos outros, não só para trás. Isso permite autocorreção em tempo real, ou seja, um token considerado menos seguro pode ser "re-noisado" e reavaliado nas passes seguintes.

Esta propriedade abre caminho a tarefas onde o resultado não é naturalmente da esquerda para a direita. O exemplo apresentado oficialmente é Sudoku, onde a impressão sequencial dificulta o raciocínio em função de restrições futuras. O modelo base resolvia 0% dos puzzles, mas basta uma receita de fine-tuning simples com a biblioteca JAX para chegar a 80% de sucesso, com paragem adaptativa que reduz o número de passos.

A geração em bloco também ajuda em cenários como preenchimento de codigo, edição no meio de um documento, fecho de estruturas markdown ou geração de sequencias biológicas... qualquer tarefa com dependencias bidirecionais.

Cloud ou local, o ecossistema de ferramentas ja esta montado. Os pesos estao disponíveis no Hugging Face, com suporte oficial em Transformers, vLLM, SGLang e MLX para Mac. Para quantização, versoes oficiais em NVFP4 cabem em menos de 18 GB de VRAM, o que permite rodar o modelo em placas como RTX 4090, RTX 5090 e DGX Spark. O suporte a llama.cpp esta previsto.

Múltiplas conversações exigem uma cautela adicional: no modo thinking, o histórico deve manter apenas as respostas finais; se o conteúdo de pensamento for preservado diretamente, a qualidade degrada com o turno.

O DiffusionGemma não substitui um modelo de produção: e uma ferramenta complementar. A sua verdadeira vantagem esta em fluxos interactivos, locais e com latencia critica: autocompletar em editores, geração ao vivo de codigo, re-escrita inline ou interfaces onde a velocidade e a experiencia principal.

E isolado na sua classe, pois nenhum modelo aberto corrente oferece difusão de texto em larga escala com suporte tao amplo no primeiro dia. Ver o paragrafo inteiro materializar-se a partir de ruido numa canvas e, de facto, uma sensação diferente da token stream habitual.

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

Gemini Omni 1.1 Flash
Imagem gerada por I.A.
Link Externo

Gemini Omni 1.1 Flash

Publicado em 31/08/2026 11:10

Gemini Omni 1.1 Flash é o novo modelo de geração de vídeo da Google orientado para produção, capaz de prolongar cenas até 40 segundos, criar transições entre frames definidos, acelerar protótipos em 360p e produzir resultados finais até 4K.

Visitar Link
VoiceMem - Memória para agentes de voz que combina factos, entidades e conhecimento com emoções
Imagem gerada por I.A.
Link Externo

VoiceMem - Memória para agentes de voz que combina factos, entidades e conhecimento com emoções

Publicado em 31/08/2026 11:02

VoiceMem é um sistema de memória para agentes de voz que combina factos, entidades e conhecimento com emoções, preferências e personalidade, permitindo que a IA reconheça o utilizador e recupere memórias relevantes em tempo real durante a própria conversa.

Visitar Link
Code World Model - A lógica no mundo virtual
Imagem gerada por I.A.
Link Externo

Code World Model - A lógica no mundo virtual

Publicado em 31/08/2026 10:58

Code World Model é uma abordagem de IA que usa um agente de programação como “cérebro” de mundos virtuais, mantendo estados, regras e consequências persistentes através de código executável, enquanto um modelo de vídeo transforma essa estrutura em ambientes visuais coerentes e dinâmicos.

Visitar Link
GLM-5.3-Flash confirma a pista de Ox Alpha e aperta o cerco aos modelos de fronteira
Imagem gerada por I.A.

GLM-5.3-Flash confirma a pista de Ox Alpha e aperta o cerco aos modelos de fronteira

Publicado em 31/08/2026 10:55

Bom... parece que o enigmático Ox Alpha que apareceu no OpenRouter deixou de ser apenas uma pista. A confirmação chegou:...

Ler Mais
FixAnything - Um sistema de IA que corrige artefactos e falhas em renderizações 3D
Imagem gerada por I.A.
Link Externo

FixAnything - Um sistema de IA que corrige artefactos e falhas em renderizações 3D

Publicado em 31/08/2026 10:05

FixAnything é um sistema de IA que corrige artefactos e falhas em renderizações 3D de diferentes representações (como NeRF, Gaussian Splatting, malhas ou nuvens de pontos) usando modelos generativos de vídeo para recuperar resultados visualmente mais limpos e geometricamente consistentes.

Visitar Link
Block3D - Um novo método de IA para gerar modelos 3D a partir de texto de forma rápida e eficiente
Imagem gerada por I.A.
Link Externo

Block3D - Um novo método de IA para gerar modelos 3D a partir de texto de forma rápida e eficiente

Publicado em 31/08/2026 09:55

Block3D é um novo método de IA para gerar modelos 3D a partir de texto de forma rápida e eficiente, combinando difusão por blocos com mecanismos de correção para preservar a qualidade geométrica.

Visitar Link
OVOW - (One Video, One World) - Vídeo convencional em cena 4D estruturada
Imagem gerada por I.A.
Link Externo

OVOW - (One Video, One World) - Vídeo convencional em cena 4D estruturada

Publicado em 31/08/2026 09:00

OVOW (One Video, One World) é um sistema de IA capaz de transformar um único vídeo convencional numa cena 4D estruturada, reconstruindo objetos, movimentos, deformações e relações físicas em modelos 3D prontos para simulação.

Visitar Link
A Guerra de Tokens: Como Open Source Está a Ganhar Volume mas Anthropic Domina os Lucros
Imagem gerada por I.A.

A Guerra de Tokens: Como Open Source Está a Ganhar Volume mas Anthropic Domina os Lucros

Publicado em 28/08/2026 12:05

Os últimos meses marcaram uma mudança que embora silenciosa é profunda! Durante anos, a narrativa foi dominada quase exclusivamente pelos...

Ler Mais

Abaixo encontra uma pequena lista de artigos relacionados com este tema..