Google cria co-diretor de IA para vídeos longos coerentes

Google cria co-diretor de IA para vídeos longos coerentes

Pesquisadores do Google Research apresentaram, em 24 de setembro de 2026, um framework multiagente unificado capaz de gerar narrativas em vídeo de longa duração com consistência temporal. O trabalho ataca dois problemas crônicos dos sistemas atuais: a deriva de identidade e as falhas em cascata.

O estudo é assinado pelos cientistas Yale Song e Yiwen Song.

A proposta trata a geração de vídeo em formato longo como um problema de otimização global e de rastreamento de estado do mundo. Hoje, dizem os autores, ela funciona como uma corrente de prompts isolados.

A base da pesquisa é um limite claro. Modelos de difusão já renderizam cenas realistas em segundos, mas transformá-los em motores de storytelling longo continua difícil.

A maioria dos pipelines agênticos encadeia módulos com prompts artesanais e independentes. Isso favorece o semantic drift, com mudanças sutis no figurino ou no cenário entre planos.

Favorece também as cascading failures, quando um artefato em um ativo upstream contamina a síntese de vídeo downstream. Como erros iniciais se propagam, a consistência de longo horizonte se rompe e sobra intervenção manual exaustiva.

Estruturalmente, dizem os autores, é o clássico problema de atribuição de crédito. Falhas terminais são difíceis de rastrear até os prompts que as originaram.

A isso somam-se o feature drift, em que entidades e ambientes mudam sem intenção, e o content collapse, quando a narrativa deixa de progredir muito.

Um co-diretor de vídeo sobre o gemini e o veo

A resposta do time é o AI video co-director, uma camada de orquestração construída sobre Gemini e Veo. Ela herda nativamente mecanismos de segurança como a marca d'água SynthID.

O desenho parte de uma premissa incomum: separar a síntese criativa da consistência. A qualidade vira um objetivo de tempo de teste.

O sistema formaliza o storytelling como uma busca pelo equilíbrio entre explorar estratégias narrativas novas e explotar configurações criativas que já se mostraram eficazes. Um multi-armed bandit (MAB) identifica globalmente direções promissoras.

A arquitetura usa parametrização hierárquica. Em vez de depender de cadeias rígidas de prompts, o sistema amostra trajetórias criativas abstratas.

Pode combinar, por exemplo, uma estratégia informacional, um modo narrativo de vinheta e determinado arquétipo estético.

Essas trajetórias são injetadas dinamicamente nos system prompts dos subagentes. Esse controle de cima para baixo garante que todo o pipeline opere sob uma visão unificada.

Segundo os pesquisadores, a camada é agnóstica a modelos e pode rodar sobre qualquer modelo generativo de base.

Dois loops e quatro pilares

Na prática, o pipeline executa a otimização global por meio de dois loops interligados: direcionamento estratégico e produção em múltiplos estágios.

Primeiro, o Orchestrator Agent avalia as entradas com o algoritmo MAB e escolhe uma configuração criativa em três dimensões: estratégia criativa (intenção), modo narrativo (estrutura da história) e arquétipo estético (tom visual e cinematografia). Essa configuração comanda a hierarquia de produção.

O Pre-Production Agent sintetiza um roteiro cena a cena e os ativos visuais em um storyboard único. O Production Agent então converte esse storyboard em mídia audiovisual concreta, apoiado em subagentes especializados, entre eles o Keyframe Agent.

A divulgação descreve ainda a pesquisa organizada em quatro pilares fundacionais. Cada um ataca um gargalo específico do pipeline generativo.

O pacote reúne quatro frameworks. O Co-Director será apresentado na COLM 2026.

O CANVAS tem presença prevista na EMNLP 2026. Completam a lista o A²RD e o VQQA, voltados a outras etapas do processo.

Por que isso importa

Em avaliações abrangentes, o framework demonstra ganhos em consistência narrativa entre múltiplos planos e em persistência de personagens. Gera vídeos de vários minutos enquanto mitiga a deriva visual e a propagação de erros no pipeline.

É esse encadeamento de falhas que hoje obriga equipes a revisar plano a plano. Elas refazem prompts e ativos quando um personagem troca de roupa sem motivo aparente no meio da história.

A segurança aparece como parte da arquitetura, não como camada posterior. Como as imagens, os vídeos e os áudios são produzidos por modelos do Gemini e do Veo, eles carregam proteções nativas, incluindo a marca d'água SynthID.

Para uso em produção, classificadores adicionais podem ser aplicados ao vídeo final. Eles protegem contra interações contextuais indesejadas entre clipes que, isoladamente, seriam seguros.

A ambição declarada é fazer desses sistemas parceiros criativos responsivos. Eles abstraem o trabalho de manter a continuidade visual e devolvem ao usuário a tarefa de cuidar da arte de contar histórias.

Para estúdios, agências e criadores que hoje gastam horas em ajustes manuais, a proposta sinaliza uma mudança de função. O modelo deixa de ser apenas um gerador de clipes e passa a operar como co-diretor, com planejamento explícito de continuidade ao longo de toda a narrativa.

Fontes e links

Matéria publicada originalmente em Google Research

Últimas Notícias

Google cria co-diretor de IA para vídeos longos coerentes
Gemini 3.8 Live ganha avatar com rosto e sincronia labial
GitHub defende que o chat é a interface errada para IA
commit-rewriter 0.2 passa a reescrever commits em outros branches