JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

AlayaWorld: mundo vídeo interativo e jogável da ALAYA Lab passa o minuto de coerência

AlayaWorld: mundo vídeo interativo e jogável da ALAYA Lab passa o minuto de coerência

Publicado em 13/07/2026 15:05 | Categorias: Artigos

A ALAYA Lab, ligada à Shanda AI Research, apresentou o AlayaWorld, um modelo de mundo interativo autoregressivo capaz de gerar mundos em vídeo jogáveis e de longa duração, com controlo de câmara em tempo real, troca de comandos a meio da geração e consistência de memória ao longo de horizontes longos. Descrito como um projeto de código aberto de longo prazo, o AlayaWorld pretende servir de base para trabalhos futuros em modelos de mundo vídeo, segundo o relatório técnico publicado no arXiv (2607.06291).

Em vez de autorizar explicitamente cada componente de um ambiente virtual, os modelos de mundo sintetizam de forma autoregressiva as observações futuras condicionadas ao estado actual do mundo e às interações do utilizador, permitindo que mundos jogáveis sejam gerados online. Treinados em gravações de gameplay e em vídeo do mundo real, captam aparências visuais diversas e dinâmicas físicas, abrindo oportunidades para aplicações interactivas além do gaming, incluindo inteligência encarnada.

O AlayaWorld assenta em quatro propriedades centrais... interação, consistência, estabilidade e runtime. No plano da interação, o sistema oferece dois canais de controlo: uma cache 3D renderizada com modulação leve de câmara AdaLN para navegação fundamentada e consciente da trajetória, e comutação de prompt ao nível do chunk para introduzir novos eventos a meio da geração.

Na consistência, o modelo recorre a duas formas de memória complementares: uma cache 3D explícita reprojetada para a vista consultada, que permite recordação espacial, e um embedding comprimido do histórico de frames para continuidade temporal, de modo que lugares revisitados permaneçam reconhecíveis. É este mecanismo que permite ao espectador virar à esquerda, depois à direita e olhar para trás sem que o mundo se desfaça.

A estabilidade em horizontes longos resulta de treinar sobre histórias com desvio (drift) e de um banco de erros (error bank) que reinjeta os artefactos acumulados tanto na memória como no alvo, impedindo que os erros se compilam ao longo de rollouts de cerca de um minuto. Sem este cuidado, a deriva visual tipicamente degrada a coerência ao ponto de o ambiente já não se assemelhar ao ponto de partida.

No runtime, a interação em tempo real é obtida através de destilação DMD com poucos passos (few-step) e de chunks temporais curtos, com comutação de prompt nos limites dos chunks para minimizar tanto a latência visual como a semântica. O resultado é uma geração a 24 fotogramas por segundo que responde imediatamente às ações do utilizador.

Nos comparativos de consistência com métodos existentes (DreaxX-World, lingBot-Fast e HY-World 1.5) o AlayaWorld mantém a coerência espacial quando o utilizador percorre a mesma trajecória e regressa a pontos anteriores, algo em que as abordagens concorrentes tendem a perder estabilidade. A equipa demonstra ainda mais de um minuto de geração contínua e sem desvio por clip, algo inédito entre alternativas publicamente disponíveis.

A diversidade visual é outro eixo forte: o mesmo cenário pode ser renderizado em estilos como realista, pintura a óleo, aguarela chinesa (ink wash), cyberpunk, Minecraft ou pixel, e mundos podem ser gerados em estilos de jogos reais (Genshin, Cyberpunk 2077, Elden Ring, Red Dead Redemption ou Zenless Zone Zero, entre outros). A comutação de estilo não exige reautoriação do ambiente.

A interatividade por prompt permite lançar eventos a meio da cena: numa vila aquática de Jiangnan, um comando pode disparar fogo-de-artifício, erguer um círculo de magia, fazer cair uma árvore gigante ou invocar um urso branco; num prado, um feitiço de fogo ou um fénix; numa praça, um martelo de gelo colossal. O mesmo mundo reage a comandos distintos sem perder a identidade da cena.

A aposta mais profunda não é o gaming, mas a infra-estrutura: um modelo de mundo capaz de sustentar ambientes interactivos coerentes a esta duração torna-se utilizável para treinar e avaliar robôs, veículos autónomos e outros sistemas de IA encarnada que hoje não dispõem de uma alternativa de simulação open-source adequada. A coerência temporal longa é precisamente o que falta à maioria das simulações geradas.

Como projeto full-stack e open-source, o AlayaWorld disponibiliza código no GitHub, um relatório técnico e uma demonstração interactiva onde qualquer pessoa pode caminhar até uma pirâmide e lançar um feitiço para ver o efeito desenrolar-se. A equipa identifica Kaipeng Zhang como core lead e Chuanhao Li como lead, com um conjunto alargado de contribuidores, e aponta contacto via Shanda para colaborações ou parcerias comerciais.

Num momento em que os modelos de mundo vídeo proliferam, a contribuição do AlayaWorld é menos um salto isolado de qualidade visual e mais a combinação rara de código aberto, jogabilidade, controlo de câmara de seis graus de liberdade e coerência superior a 60 segundos. Isso posiciona-o como infra-estrutura de investigação, não apenas como demo, para quem quer estudar mundos generativos sustentados.

Se quiser saber mais, por favor visite : https://alaya-lab.github.io/AlayaWorld/

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

Ontology Engineering: o futuro prometido da IA que ainda tem de provar o seu valor
Imagem gerada por I.A.

Ontology Engineering: o futuro prometido da IA que ainda tem de provar o seu valor

Publicado em 25/08/2026 18:56

No levantamento sobre engenharia de grafos publicado em Agosto de 2026, abordado no artigo anterior, os investigadores dedicam uma das...

Ler Mais
Graph Engineering: a engenharia de grafos como novo paradigma dos agentes LLM
Imagem gerada por I.A.

Graph Engineering: a engenharia de grafos como novo paradigma dos agentes LLM

Publicado em 25/08/2026 18:35

Uma equipa alargada de investigadores, com nomes ligados à University of Illinois Urbana-Champaign e à Sichuan University, publicou em Agosto...

Ler Mais
Intismeran e melanoma: o avanço da vacina de mRNA que exige entusiasmo com método
Imagem gerada por I.A.

Intismeran e melanoma: o avanço da vacina de mRNA que exige entusiasmo com método

Publicado em 23/08/2026 20:00

Alegadamente... há uma boa notícia na investigação do cancro, mas não estamos perante uma “cura descoberta por inteligência artificial”.. não...

Ler Mais
OpenAI abranda trabalho em Astra: segurança cibernética não confirma um “GPT-6 adiado”
Imagem gerada por I.A.

OpenAI abranda trabalho em Astra: segurança cibernética não confirma um “GPT-6 adiado”

Publicado em 23/08/2026 16:40

A OpenAI confirmou que abrandou temporariamente o desenvolvimento de modelos de fronteira enquanto reforça medidas de segurança relacionadas com capacidades...

Ler Mais
Ox Alpha: o que se sabe sobre o modelo anónimo — e o que continua a ser rumor
Imagem gerada por I.A.

Ox Alpha: o que se sabe sobre o modelo anónimo — e o que continua a ser rumor

Publicado em 23/08/2026 14:30

É... o Ox Alpha apareceu como um modelo anónimo em plataformas usadas por programadores e depressa gerou o habitual frenesim...

Ler Mais
Claude Academy: formação gratuita que começa pelaquilo que os modelos não sabem fazer
Imagem gerada por I.A.

Claude Academy: formação gratuita que começa pelaquilo que os modelos não sabem fazer

Publicado em 23/08/2026 12:15

A Claude Academy é a plataforma de aprendizagem da Anthropic para quem quer usar os seus produtos com mais método....

Ler Mais
Ornith-1.5: o modelo que cria o próprio currículo, mas ainda tem de provar serviço
Imagem gerada por I.A.

Ornith-1.5: o modelo que cria o próprio currículo, mas ainda tem de provar serviço

Publicado em 23/08/2026 12:00

O Ornith-1.5 chega com uma promessa que merece alguma atenção (ou muita), pois em vez de depender apenas de tarefas...

Ler Mais
GEN 1.5
Créditos de imagem : generalistai.com
Link Externo

GEN 1.5

Publicado em 23/08/2026 11:15

GEN-1.5 é um modelo fundacional para robótica capaz de aprender novas tarefas físicas em segundos a partir de uma única demonstração, sem treino adicional, além de generalizar, improvisar e utilizar ferramentas nunca vistas.

Visitar Link

Abaixo encontra uma pequena lista de artigos relacionados com este tema..