Pesquisadores do Google Research apresentaram, em 24 de setembro de 2026, um framework multiagente unificado capaz de gerar narrativas em vídeo de longa duração com consistência temporal. O trabalho ataca dois problemas crônicos dos sistemas atuais: a deriva de identidade e as falhas em cascata.
O estudo é assinado pelos cientistas Yale Song e Yiwen Song.
A proposta trata a geração de vídeo em formato longo como um problema de otimização global e de rastreamento de estado do mundo. Hoje, dizem os autores, ela funciona como uma corrente de prompts isolados.
A base da pesquisa é um limite claro. Modelos de difusão já renderizam cenas realistas em segundos, mas transformá-los em motores de storytelling longo continua difícil.
A maioria dos pipelines agênticos encadeia módulos com prompts artesanais e independentes. Isso favorece o semantic drift, com mudanças sutis no figurino ou no cenário entre planos.
Favorece também as cascading failures, quando um artefato em um ativo upstream contamina a síntese de vídeo downstream. Como erros iniciais se propagam, a consistência de longo horizonte se rompe e sobra intervenção manual exaustiva.
Estruturalmente, dizem os autores, é o clássico problema de atribuição de crédito. Falhas terminais são difíceis de rastrear até os prompts que as originaram.
A isso somam-se o feature drift, em que entidades e ambientes mudam sem intenção, e o content collapse, quando a narrativa deixa de progredir muito.
Um co-diretor de vídeo sobre o gemini e o veo
A resposta do time é o AI video co-director, uma camada de orquestração construída sobre Gemini e Veo. Ela herda nativamente mecanismos de segurança como a marca d'água SynthID.
O desenho parte de uma premissa incomum: separar a síntese criativa da consistência. A qualidade vira um objetivo de tempo de teste.
O sistema formaliza o storytelling como uma busca pelo equilíbrio entre explorar estratégias narrativas novas e explotar configurações criativas que já se mostraram eficazes. Um multi-armed bandit (MAB) identifica globalmente direções promissoras.
A arquitetura usa parametrização hierárquica. Em vez de depender de cadeias rígidas de prompts, o sistema amostra trajetórias criativas abstratas.
Pode combinar, por exemplo, uma estratégia informacional, um modo narrativo de vinheta e determinado arquétipo estético.
Essas trajetórias são injetadas dinamicamente nos system prompts dos subagentes. Esse controle de cima para baixo garante que todo o pipeline opere sob uma visão unificada.
Segundo os pesquisadores, a camada é agnóstica a modelos e pode rodar sobre qualquer modelo generativo de base.
Dois loops e quatro pilares
Na prática, o pipeline executa a otimização global por meio de dois loops interligados: direcionamento estratégico e produção em múltiplos estágios.
Primeiro, o Orchestrator Agent avalia as entradas com o algoritmo MAB e escolhe uma configuração criativa em três dimensões: estratégia criativa (intenção), modo narrativo (estrutura da história) e arquétipo estético (tom visual e cinematografia). Essa configuração comanda a hierarquia de produção.
O Pre-Production Agent sintetiza um roteiro cena a cena e os ativos visuais em um storyboard único. O Production Agent então converte esse storyboard em mídia audiovisual concreta, apoiado em subagentes especializados, entre eles o Keyframe Agent.
A divulgação descreve ainda a pesquisa organizada em quatro pilares fundacionais. Cada um ataca um gargalo específico do pipeline generativo.
O pacote reúne quatro frameworks. O Co-Director será apresentado na COLM 2026.
O CANVAS tem presença prevista na EMNLP 2026. Completam a lista o A²RD e o VQQA, voltados a outras etapas do processo.
Por que isso importa
Em avaliações abrangentes, o framework demonstra ganhos em consistência narrativa entre múltiplos planos e em persistência de personagens. Gera vídeos de vários minutos enquanto mitiga a deriva visual e a propagação de erros no pipeline.
É esse encadeamento de falhas que hoje obriga equipes a revisar plano a plano. Elas refazem prompts e ativos quando um personagem troca de roupa sem motivo aparente no meio da história.
A segurança aparece como parte da arquitetura, não como camada posterior. Como as imagens, os vídeos e os áudios são produzidos por modelos do Gemini e do Veo, eles carregam proteções nativas, incluindo a marca d'água SynthID.
Para uso em produção, classificadores adicionais podem ser aplicados ao vídeo final. Eles protegem contra interações contextuais indesejadas entre clipes que, isoladamente, seriam seguros.
A ambição declarada é fazer desses sistemas parceiros criativos responsivos. Eles abstraem o trabalho de manter a continuidade visual e devolvem ao usuário a tarefa de cuidar da arte de contar histórias.
Para estúdios, agências e criadores que hoje gastam horas em ajustes manuais, a proposta sinaliza uma mudança de função. O modelo deixa de ser apenas um gerador de clipes e passa a operar como co-diretor, com planejamento explícito de continuidade ao longo de toda a narrativa.







