Runway detalha a engenharia por trás do WorldPrompt, controle de mundos gerados em tempo real
No GWM Worlds 2, lançado em setembro de 2026, a Runway usa diffusion autoregressiva e destilação agressiva para permitir prompts com ações cronometradas dentro de vídeo e áudio sincronizados gerados quadro a quadro.

No GWM Worlds 2, lançado em setembro de 2026, a Runway usa diffusion autoregressiva e destilação agressiva para permitir prompts com ações cronometradas dentro de vídeo e áudio sincronizados gerados quadro a quadro.
A Runway, avaliada em US$ 5,3 bilhões após uma rodada de US$ 315 milhões em fevereiro de 2026, lançou no início de setembro de 2026 o GWM Worlds 2, sucessor do GWM Worlds original (dezembro de 2025). A novidade técnica central não é só "vídeo em tempo real": é o WorldPrompt, um formato de entrada que fixa aspectos de um ambiente simulado (incluindo o primeiro frame) e permite descrever uma sequência de eventos com timestamp, alguns deles injetáveis ao vivo enquanto o mundo já está sendo gerado. A cobertura da Latent Space, com entrevistas ao CTO Kamil Sindi, ao cientista principal Robin Kahlow e comentários do co-CEO Anastasis Germanidis, detalha como isso foi construído e onde ainda quebra.
O que é, na prática, o WorldPrompt
WorldPrompt não é uma linguagem de programação nem um sistema de scripting como o que roda por trás de Minecraft ou Roblox: como observa a reportagem da Latent Space, é um mecanismo de prompting, não uma forma de controlar estado explícito. Kahlow descreveu a lógica por trás disso como uma camada de controle sobre personagens, câmera e ambiente: se há um NPC na cena, o prompt pode fazer esse NPC caminhar até o usuário e falar algo, do mesmo jeito que se descreveria uma ação num jogo, mas sem exposição de variáveis de estado para o desenvolvedor manipular depois.
Sindi resume a proposta de valor: dá para criar "mundos promptáveis sob demanda, com vídeo e áudio em sincronia, em diferentes domínios e ambientes" sem depender de assets pré-modelados. Para quem constrói ferramentas de conteúdo gerado, isso substitui pipelines de motor de jogo tradicional (geometria, texturas, física scriptada) por uma superfície de controle baseada em linguagem natural e timestamps, o que é mais rápido de iterar mas oferece bem menos garantia de comportamento determinístico.
Como um modelo de vídeo vira um runtime em tempo real
O problema de engenharia que a Runway teve que resolver, segundo Kahlow, tem duas frentes: fazer o modelo gerar quadro a quadro (em vez de um clipe inteiro de uma vez) e fazer essa geração rápida o suficiente para rodar enquanto o usuário está olhando. O GWM Worlds 2 entrega vídeo contínuo em 720p a 24 fps com áudio a 48.000 Hz, e o caminho até lá passou por três etapas descritas pela equipe:
- Partir do modelo fundacional de áudio-vídeo da Runway e fazer fine-tuning no formato WorldPrompt.
- Post-treinar o modelo para gerar de forma autoregressiva (cada frame condicionado nos anteriores, em vez de diffusion bidirecional que produz o vídeo inteiro de uma vez).
- Destilar o modelo para reduzir latência.
Germanidis detalhou a destilação em números concretos: um modelo pode sair de algo como 50 passos de denoising para 4, com alguma perda de qualidade mas resultado potencialmente comparável. Ele descreveu duas formas possíveis de destilação, destilar um modelo grande em um menor, ou simplesmente reduzir os passos de diffusion, e disse que o processo parte de "diffusion bidirecional que gera um vídeo inteiro de uma vez" e o transforma em algo que "gera um ou poucos frames por vez".
Para quem trabalha com geração de vídeo, essa é a parte mais replicável do artigo: é o mesmo trade-off de qualidade versus latência que já aparece em destilação de modelos de imagem (SDXL Turbo, LCM) e de modelos de linguagem↳LLMs48 conteúdosConsiderações básicas de hardware para modelos de linguagem em código aberto: Memória, Desempenho e ViabilidadeMarketing Tech · out 2025Modelos de linguagem sob ataque: o lado obscuro da IA generativaDevSecOps · mai 2025Criando um LLM – modelo de linguagem de grande escala – do zero com TransformersAI · abr 2024Ver tudo em AI →, só que aplicado a um domínio onde o erro de um frame se propaga para o próximo.
Erro acumulado e memória: os dois gargalos abertos
Germanidis foi direto sobre o principal problema dos modelos autoregressivos: "o maior desafio é o acúmulo de erro. Você realimenta frames gerados no modelo para gerar os próximos, e se há pequenos erros, eles se acumulam ao longo do tempo." Isso é análogo ao que já se conhece em RAG e agentes de LLM com contexto longo: pequenos desvios em cada passo compõem uma trajetória cada vez mais distante do esperado, só que aqui o efeito é visual e sonoro, não textual.
Sindi acrescentou o problema de gerenciamento de memória: decidir "o que manter de contexto, o que descartar" para não estourar a memória da GPU em gerações potencialmente infinitas. Kahlow reforçou que memória de longo prazo continua sendo um "problema de pesquisa em aberto": o modelo não tem memória perfeita do que já aconteceu na cena. Para comparação, o Genie 3 do Google DeepMind, citado no mesmo artigo, também gera a 720p e 24 fps mas suporta apenas "alguns minutos de interação contínua, em vez de horas estendidas", segundo a própria Google. Isso coloca o GWM Worlds 2 na mesma classe de limitação temporal que a concorrência (Genie 3, Odyssey-2 Pro, RTFM da World Labs), não numa categoria à parte.
Causalidade: o problema que separa vídeo de mundo
Há uma distinção que Germanidis traça entre "modelo de vídeo" e "modelo de mundo": geração contrafactual. Ele usa o exemplo de futebol, dados de treino da internet têm muito mais gols certos do que chutes errados, então um modelo de vídeo tende a renderizar o acerto de forma mais convincente que o erro. Um modelo de mundo precisa gerar consequências igualmente plausíveis para ações diferentes do usuário, o que é uma restrição bem mais dura do que simplesmente gerar pixels realistas.
Sindi apontou que avaliar isso fica mais difícil à medida que a interação fica mais complexa: em cenários multi-prompt, multi-personagem, multi-cena, é difícil isolar o que foi causal do que não foi. A resposta da Runway por ora é uma combinação de testes automatizados↳Testes automatizados4 conteúdosComo migrei meus testes automatizados de Java para Ruby… Será que fiz bem?Dev (Back & Front) · jun 2019TDD em Nodejs: conhecendo o JestDev (Back & Front) · mar 2019Arquitetura Hexagonal na prática com exemplos em PythonDev (Back & Front) · mai 2025Ver tudo em Dev (Back & Front) → verificáveis com teste manual exploratório, o que Kahlow resume como "testar seu modelo para ver o que não funciona é muito importante", um lembrete de que, sendo research preview, qualquer integração de produção precisa de camada própria de validação, não só confiar no benchmark do fabricante.
Casos de uso além de jogos: agentes e dados sintéticos
O ângulo mais relevante para quem constrói produto de IA, e não só conteúdo visual, é o uso do GWM Worlds como ambiente de teste para agentes em escala. Kahlow apontou que ter milhares de ambientes simulados fica muito menos custoso com um modelo desse tipo. Um detalhe técnico importante: não existe estado estruturado exposto ao agente. "Não há estado estruturado aqui", disse Kahlow. "É só observar a mesma coisa que você observaria na vida real, só que a partir de câmeras." Isso significa que qualquer agente que consuma esse ambiente precisa operar por percepção visual/sonora pura, sem um JSON de estado do mundo para consultar, o que aproxima o problema de treinar agentes de robótica do mundo físico mais do que de treinar agentes em ambientes de jogo tradicionais com API de estado.
Sindi também mencionou geração de dados sintéticos para agentes como outro uso direto, e Germanidis projetou o encaixe com modelos de raciocínio: um modelo de linguagem cuidaria do planejamento da cena, passando instruções para a "cabeça de diffusion" responsável por gerar os pixels, uma divisão de trabalho parecida com a que já se vê em pipelines de agentes que separam planejamento (LLM) de execução (ferramenta especializada).
O que muda para quem constrói
Para equipes de conteúdo gerado e simulação, o GWM Worlds 2 ainda é research preview: sem scripting, com erro acumulado documentado pelo próprio fabricante, memória de curto prazo e nenhuma garantia formal de causalidade. Isso descarta, por enquanto, uso em produção onde previsibilidade importa (treinamento de robótica com garantias de segurança, por exemplo). Onde já vale explorar é em prototipagem de ambientes de teste para agentes e geração de dados sintéticos em domínios onde o custo de simular no mundo real é alto, contanto que a equipe assuma o ônus de validar causalidade e monitorar acúmulo de erro por conta própria, como a própria Runway recomenda.
Fonte: Latent Space
Este artigo foi escrito por Alan Andrade, colunista de inteligência artificial. Conteúdo produzido por agente de IA da redação iMasters, sob revisão editorial humana. Saiba como produzimos no expediente.
UK AISI adota infraestrutura da EvalEval para publicar benchmarks de IA com configuração verificável
Instituto britânico de segurança em IA passou a divulgar resultados de avaliação junto com a configuração completa de cada teste, usando o schema aberto Every Eval Ever da coalizão EvalEval.














