JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

Wan-Streamer v0.2: resolução superior a 640×368 com a mesma latência de ~200 ms

Wan-Streamer v0.2: resolução superior a 640×368 com a mesma latência de ~200 ms

Publicado em 13/07/2026 16:10 | Categorias: Artigos

A equipa Wan da Alibaba apresentou o Wan-Streamer v0.2, uma actualização do modelo de interação áudio-visual nativamente em streaming que sobe a resolução do vídeo interativo sem agravar a latência. O sistema parte da formulação de streaming nativo da v0.1 ( em que texto, áudio e vídeo do utilizador e do agente partilham uma única linha temporal causal modelada por um único Transformer) e eleva o fluxo de saída de 192x336 para 640x368, mantendo cerca de 200 ms de latência do lado do modelo a 25 fotogramas por segundo.

A interação áudio-visual em tempo real situa-se na intersecção de vários domínios: diálogo falado full-duplex, percepção multimodal, geração de vídeo em streaming e agentes visuais interactivos. O Wan-Streamer v0.1 já tinha estabelecido uma formulação de streaming nativo para este cenário, em que a percepção, o estado e a síntese visual coabitam numa só arquitectura causal; a v0.2 preserva essa formulação e foca-se em tirar partido dela para entregar um vídeo mais nítido sem comprometer a responsividade.

Relativamente à base v0.1, a v0.2 altera três eixos. O fluxo de saída sobe para 640x368, o caminho caro de geração latent é movido para um performer de contexto-paralelo estilo Ulysses, e a composição visual suportada expande-se dos planos próximos (close-up) de videochamada para agentes em plano médio (mid-shot) ancorados no cenário, com corpo e contexto de fundo legíveis. A taxa de 25 fps e o orçamento de latência interativa baixa mantêm-se inalterados.

Na comparação directa, a resolução passa de 192x336 para 640x368 e a latência do lado do modelo permanece em torno de 200 ms, sem mudança. Com um orçamento de rede bidirecional de 350 ms, a latência total de interação remota fica perto de 550 ms, também inalterada. O que muda é a topologia de serviço: o thinker continua numa única GPU, enquanto o performer passa a usar contexto-paralelo multi-GPU.

A chave para manter a latência com mais resolução é a divisão thinker–performer. O Wan-Streamer é treinado como um único modelo end-to-end, mas para implantação em tempo real esse mesmo modelo é partido numa pipeline em que o thinker ocupa uma GPU e o performer forma um grupo multi-GPU de contexto-paralelo estilo Ulysses. O thinker gere a percepção, a actualização de estado e a descodificação final; o performer absorve o caminho dispendioso de geração latent de alta resolução.

Em detalhe, o thinker alberga os codificadores causais de áudio e vídeo, a passagem curta de Transformer para linguagem e estado, a construção da cache K/V e os descodificadores causais que convertem os latents da unidade anterior em áudio e vídeo para emissão imediata. O performer retém apenas o caminho de geração latent: cada rank recebe a fatia K/V actual, actualiza a sua cache local e executa a desnovação (denoising) de contexto-paralelo Ulysses para a próxima unidade.

A sequência de vídeo latent de alta resolução é a sequência longa que é dividida pelos ranks; os latents de áudio numa unidade de 160 ms contêm poucos tokens e não sofrem fragmentação de sequência. A parte de linguagem e estado não se torna numa sequência de performer separada — já está representada na cache K/V produzida pelo thinker, o que evita comunicação extra dentro do grupo performer. O all-to-all/gather do Ulysses fica confinado ao grupo performer.

Esta planificação coloca em pipeline a percepção do frame actual, a descodificação do frame anterior, a transferência K/V e latent entre thinker e performer, e a desnovação do vídeo latent do frame seguinte, repartidas por unidades de streaming adjacentes. O débito em tempo real mantém-se desde que o tempo do grupo performer mais a comunicação caiba numa unidade de 160 ms; o caminho sinal-a-sinal — codificar, actualizar estado, gerar latent, descodificar — continua com o alvo de ~200 ms do lado do modelo.

Do ponto de vista da experiência, o prefill é quase instantâneo: em cerca de 0,5 segundo, o comando em linguagem natural entra em efeito, thinker e performer ficam pré-carregados e a nova cena entra em sessão ao vivo para o utilizador. As demonstrações publicadas não estão aceleradas — mostram a latência real de ponta a ponta, incluindo o tempo de rede, sem retemporização nem composição pós-processada.

As demonstrações abrangem formatos paisagem e retrato, com cenas desencadeadas por prompts em linguagem natural: um alienígena de orelhas longas numa caverna escura, um tutor de peruca branca num estudo à luz de vela, uma criança de pijama de pato, uma mulher de camisola vermelha em videochamada, gatos, um terrier a escavar na praia, a Mona Lisa com o seu fundo, o Charizard numa sala de reuniões ou Qin Shi Huang num palácio à luz de vela. A variedade ilustra tanto o close-up como os novos agentes mid-shot com cenário legível.

Para além das videochamadas, a mudança para agentes ancorados no cenário abre caminho a aplicações de IA encarnada e a agentes visuais interactivos consistentes, onde o corpo e o ambiente em redor importam tanto quanto o rosto. É aí que a resolução 640x368 e a leitura de contexto de cena se tornam relevantes, permitindo interações que já não se restringem a um plano apertado.

O Wan-Streamer v0.2 é um exemplo claro de como a investigação de serviço (serving) pode valer tanto como a de modelo: em vez de escalar tudo cegamente, a equipa reparte o modelo treinado num thinker de baixa latência e num performer de contexto-paralelo, sustentando uma resolução muito superior ao mesmo custo de latência. É uma lição de arquitectura de inferência para sistemas de vídeo em tempo real.

Se quiser saber mais, por favor visite : https://wan-streamer.com/v0.2/

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

Gemini Omni 1.1 Flash
Imagem gerada por I.A.
Link Externo

Gemini Omni 1.1 Flash

Publicado em 31/08/2026 11:10

Gemini Omni 1.1 Flash é o novo modelo de geração de vídeo da Google orientado para produção, capaz de prolongar cenas até 40 segundos, criar transições entre frames definidos, acelerar protótipos em 360p e produzir resultados finais até 4K.

Visitar Link
VoiceMem - Memória para agentes de voz que combina factos, entidades e conhecimento com emoções
Imagem gerada por I.A.
Link Externo

VoiceMem - Memória para agentes de voz que combina factos, entidades e conhecimento com emoções

Publicado em 31/08/2026 11:02

VoiceMem é um sistema de memória para agentes de voz que combina factos, entidades e conhecimento com emoções, preferências e personalidade, permitindo que a IA reconheça o utilizador e recupere memórias relevantes em tempo real durante a própria conversa.

Visitar Link
Code World Model - A lógica no mundo virtual
Imagem gerada por I.A.
Link Externo

Code World Model - A lógica no mundo virtual

Publicado em 31/08/2026 10:58

Code World Model é uma abordagem de IA que usa um agente de programação como “cérebro” de mundos virtuais, mantendo estados, regras e consequências persistentes através de código executável, enquanto um modelo de vídeo transforma essa estrutura em ambientes visuais coerentes e dinâmicos.

Visitar Link
GLM-5.3-Flash confirma a pista de Ox Alpha e aperta o cerco aos modelos de fronteira
Imagem gerada por I.A.

GLM-5.3-Flash confirma a pista de Ox Alpha e aperta o cerco aos modelos de fronteira

Publicado em 31/08/2026 10:55

Bom... parece que o enigmático Ox Alpha que apareceu no OpenRouter deixou de ser apenas uma pista. A confirmação chegou:...

Ler Mais
FixAnything - Um sistema de IA que corrige artefactos e falhas em renderizações 3D
Imagem gerada por I.A.
Link Externo

FixAnything - Um sistema de IA que corrige artefactos e falhas em renderizações 3D

Publicado em 31/08/2026 10:05

FixAnything é um sistema de IA que corrige artefactos e falhas em renderizações 3D de diferentes representações (como NeRF, Gaussian Splatting, malhas ou nuvens de pontos) usando modelos generativos de vídeo para recuperar resultados visualmente mais limpos e geometricamente consistentes.

Visitar Link
Block3D - Um novo método de IA para gerar modelos 3D a partir de texto de forma rápida e eficiente
Imagem gerada por I.A.
Link Externo

Block3D - Um novo método de IA para gerar modelos 3D a partir de texto de forma rápida e eficiente

Publicado em 31/08/2026 09:55

Block3D é um novo método de IA para gerar modelos 3D a partir de texto de forma rápida e eficiente, combinando difusão por blocos com mecanismos de correção para preservar a qualidade geométrica.

Visitar Link
OVOW - (One Video, One World) - Vídeo convencional em cena 4D estruturada
Imagem gerada por I.A.
Link Externo

OVOW - (One Video, One World) - Vídeo convencional em cena 4D estruturada

Publicado em 31/08/2026 09:00

OVOW (One Video, One World) é um sistema de IA capaz de transformar um único vídeo convencional numa cena 4D estruturada, reconstruindo objetos, movimentos, deformações e relações físicas em modelos 3D prontos para simulação.

Visitar Link
A Guerra de Tokens: Como Open Source Está a Ganhar Volume mas Anthropic Domina os Lucros
Imagem gerada por I.A.

A Guerra de Tokens: Como Open Source Está a Ganhar Volume mas Anthropic Domina os Lucros

Publicado em 28/08/2026 12:05

Os últimos meses marcaram uma mudança que embora silenciosa é profunda! Durante anos, a narrativa foi dominada quase exclusivamente pelos...

Ler Mais

Abaixo encontra uma pequena lista de artigos relacionados com este tema..