JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

AlayaWorld: mundo vídeo interativo e jogável da ALAYA Lab passa o minuto de coerência

AlayaWorld: mundo vídeo interativo e jogável da ALAYA Lab passa o minuto de coerência

Publicado em 13/07/2026 15:05 | Categorias: Artigos

A ALAYA Lab, ligada à Shanda AI Research, apresentou o AlayaWorld, um modelo de mundo interativo autoregressivo capaz de gerar mundos em vídeo jogáveis e de longa duração, com controlo de câmara em tempo real, troca de comandos a meio da geração e consistência de memória ao longo de horizontes longos. Descrito como um projeto de código aberto de longo prazo, o AlayaWorld pretende servir de base para trabalhos futuros em modelos de mundo vídeo, segundo o relatório técnico publicado no arXiv (2607.06291).

Em vez de autorizar explicitamente cada componente de um ambiente virtual, os modelos de mundo sintetizam de forma autoregressiva as observações futuras condicionadas ao estado actual do mundo e às interações do utilizador, permitindo que mundos jogáveis sejam gerados online. Treinados em gravações de gameplay e em vídeo do mundo real, captam aparências visuais diversas e dinâmicas físicas, abrindo oportunidades para aplicações interactivas além do gaming, incluindo inteligência encarnada.

O AlayaWorld assenta em quatro propriedades centrais... interação, consistência, estabilidade e runtime. No plano da interação, o sistema oferece dois canais de controlo: uma cache 3D renderizada com modulação leve de câmara AdaLN para navegação fundamentada e consciente da trajetória, e comutação de prompt ao nível do chunk para introduzir novos eventos a meio da geração.

Na consistência, o modelo recorre a duas formas de memória complementares: uma cache 3D explícita reprojetada para a vista consultada, que permite recordação espacial, e um embedding comprimido do histórico de frames para continuidade temporal, de modo que lugares revisitados permaneçam reconhecíveis. É este mecanismo que permite ao espectador virar à esquerda, depois à direita e olhar para trás sem que o mundo se desfaça.

A estabilidade em horizontes longos resulta de treinar sobre histórias com desvio (drift) e de um banco de erros (error bank) que reinjeta os artefactos acumulados tanto na memória como no alvo, impedindo que os erros se compilam ao longo de rollouts de cerca de um minuto. Sem este cuidado, a deriva visual tipicamente degrada a coerência ao ponto de o ambiente já não se assemelhar ao ponto de partida.

No runtime, a interação em tempo real é obtida através de destilação DMD com poucos passos (few-step) e de chunks temporais curtos, com comutação de prompt nos limites dos chunks para minimizar tanto a latência visual como a semântica. O resultado é uma geração a 24 fotogramas por segundo que responde imediatamente às ações do utilizador.

Nos comparativos de consistência com métodos existentes (DreaxX-World, lingBot-Fast e HY-World 1.5) o AlayaWorld mantém a coerência espacial quando o utilizador percorre a mesma trajecória e regressa a pontos anteriores, algo em que as abordagens concorrentes tendem a perder estabilidade. A equipa demonstra ainda mais de um minuto de geração contínua e sem desvio por clip, algo inédito entre alternativas publicamente disponíveis.

A diversidade visual é outro eixo forte: o mesmo cenário pode ser renderizado em estilos como realista, pintura a óleo, aguarela chinesa (ink wash), cyberpunk, Minecraft ou pixel, e mundos podem ser gerados em estilos de jogos reais (Genshin, Cyberpunk 2077, Elden Ring, Red Dead Redemption ou Zenless Zone Zero, entre outros). A comutação de estilo não exige reautoriação do ambiente.

A interatividade por prompt permite lançar eventos a meio da cena: numa vila aquática de Jiangnan, um comando pode disparar fogo-de-artifício, erguer um círculo de magia, fazer cair uma árvore gigante ou invocar um urso branco; num prado, um feitiço de fogo ou um fénix; numa praça, um martelo de gelo colossal. O mesmo mundo reage a comandos distintos sem perder a identidade da cena.

A aposta mais profunda não é o gaming, mas a infra-estrutura: um modelo de mundo capaz de sustentar ambientes interactivos coerentes a esta duração torna-se utilizável para treinar e avaliar robôs, veículos autónomos e outros sistemas de IA encarnada que hoje não dispõem de uma alternativa de simulação open-source adequada. A coerência temporal longa é precisamente o que falta à maioria das simulações geradas.

Como projeto full-stack e open-source, o AlayaWorld disponibiliza código no GitHub, um relatório técnico e uma demonstração interactiva onde qualquer pessoa pode caminhar até uma pirâmide e lançar um feitiço para ver o efeito desenrolar-se. A equipa identifica Kaipeng Zhang como core lead e Chuanhao Li como lead, com um conjunto alargado de contribuidores, e aponta contacto via Shanda para colaborações ou parcerias comerciais.

Num momento em que os modelos de mundo vídeo proliferam, a contribuição do AlayaWorld é menos um salto isolado de qualidade visual e mais a combinação rara de código aberto, jogabilidade, controlo de câmara de seis graus de liberdade e coerência superior a 60 segundos. Isso posiciona-o como infra-estrutura de investigação, não apenas como demo, para quem quer estudar mundos generativos sustentados.

Se quiser saber mais, por favor visite : https://alaya-lab.github.io/AlayaWorld/

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

Gemini Omni 1.1 Flash
Imagem gerada por I.A.
Link Externo

Gemini Omni 1.1 Flash

Publicado em 31/08/2026 11:10

Gemini Omni 1.1 Flash é o novo modelo de geração de vídeo da Google orientado para produção, capaz de prolongar cenas até 40 segundos, criar transições entre frames definidos, acelerar protótipos em 360p e produzir resultados finais até 4K.

Visitar Link
VoiceMem - Memória para agentes de voz que combina factos, entidades e conhecimento com emoções
Imagem gerada por I.A.
Link Externo

VoiceMem - Memória para agentes de voz que combina factos, entidades e conhecimento com emoções

Publicado em 31/08/2026 11:02

VoiceMem é um sistema de memória para agentes de voz que combina factos, entidades e conhecimento com emoções, preferências e personalidade, permitindo que a IA reconheça o utilizador e recupere memórias relevantes em tempo real durante a própria conversa.

Visitar Link
Code World Model - A lógica no mundo virtual
Imagem gerada por I.A.
Link Externo

Code World Model - A lógica no mundo virtual

Publicado em 31/08/2026 10:58

Code World Model é uma abordagem de IA que usa um agente de programação como “cérebro” de mundos virtuais, mantendo estados, regras e consequências persistentes através de código executável, enquanto um modelo de vídeo transforma essa estrutura em ambientes visuais coerentes e dinâmicos.

Visitar Link
GLM-5.3-Flash confirma a pista de Ox Alpha e aperta o cerco aos modelos de fronteira
Imagem gerada por I.A.

GLM-5.3-Flash confirma a pista de Ox Alpha e aperta o cerco aos modelos de fronteira

Publicado em 31/08/2026 10:55

Bom... parece que o enigmático Ox Alpha que apareceu no OpenRouter deixou de ser apenas uma pista. A confirmação chegou:...

Ler Mais
FixAnything - Um sistema de IA que corrige artefactos e falhas em renderizações 3D
Imagem gerada por I.A.
Link Externo

FixAnything - Um sistema de IA que corrige artefactos e falhas em renderizações 3D

Publicado em 31/08/2026 10:05

FixAnything é um sistema de IA que corrige artefactos e falhas em renderizações 3D de diferentes representações (como NeRF, Gaussian Splatting, malhas ou nuvens de pontos) usando modelos generativos de vídeo para recuperar resultados visualmente mais limpos e geometricamente consistentes.

Visitar Link
Block3D - Um novo método de IA para gerar modelos 3D a partir de texto de forma rápida e eficiente
Imagem gerada por I.A.
Link Externo

Block3D - Um novo método de IA para gerar modelos 3D a partir de texto de forma rápida e eficiente

Publicado em 31/08/2026 09:55

Block3D é um novo método de IA para gerar modelos 3D a partir de texto de forma rápida e eficiente, combinando difusão por blocos com mecanismos de correção para preservar a qualidade geométrica.

Visitar Link
OVOW - (One Video, One World) - Vídeo convencional em cena 4D estruturada
Imagem gerada por I.A.
Link Externo

OVOW - (One Video, One World) - Vídeo convencional em cena 4D estruturada

Publicado em 31/08/2026 09:00

OVOW (One Video, One World) é um sistema de IA capaz de transformar um único vídeo convencional numa cena 4D estruturada, reconstruindo objetos, movimentos, deformações e relações físicas em modelos 3D prontos para simulação.

Visitar Link
A Guerra de Tokens: Como Open Source Está a Ganhar Volume mas Anthropic Domina os Lucros
Imagem gerada por I.A.

A Guerra de Tokens: Como Open Source Está a Ganhar Volume mas Anthropic Domina os Lucros

Publicado em 28/08/2026 12:05

Os últimos meses marcaram uma mudança que embora silenciosa é profunda! Durante anos, a narrativa foi dominada quase exclusivamente pelos...

Ler Mais

Abaixo encontra uma pequena lista de artigos relacionados com este tema..