AgentGarten: mundos de código com renderização neural em tempo real

shape
shape
shape
shape
shape

AgentGarten: mundos de código com renderização neural em tempo real

AgentGarten: mundos de código com renderização neural em tempo real

Um grupo ligado ao laboratório Mirros propõe o AgentGarten, um framework que separa a simulação da aparência visual em ambientes interativos para agentes.

A ideia central é manter estado, regras e dinâmica em simuladores ou engines de jogos, com transições programáveis e inspecionáveis.

A geração das observações visuais fica com um renderizador neural compartilhado, operando em tempo real.

O renderizador é destilado com um método que os autores chamam de Adversarial Forcing. Ele combina correspondência de distribuição sobre as próprias trajetórias do modelo com supervisão adversarial em dados reais.

Nos experimentos relatados, agentes baseados em modelos de fundação aprendem em cerca de 4 rodadas o que, segundo os autores, exigiria milhões de episódios em um comparativo convencional de aprendizado por reforço.

O que os autores propõem

O paper, disponível em arXiv:2610.12374, define um "code world" como a composição de três elementos: um programa de cena, uma engine que o executa e um renderizador neural.

O programa especifica geometria e regras de interação. A engine atualiza o estado (poses de objetos, articulações, variáveis de tarefa) e exporta uma condição estruturada a partir da câmera.

O renderizador gera a observação visual a partir dessa condição, de uma referência de aparência e de uma descrição textual.

A escolha arquitetural mais relevante é que a transição de estado não recebe observações renderizadas como entrada. O renderizador influencia o estado apenas por meio das ações que os agentes escolhem.

Isso significa, argumentam os autores, que erros de renderização não se acumulam no estado. Uma trajetória gravada pode ser renderizada novamente sob outra aparência ou outra câmera sem alterar os eventos subjacentes.

Novos ambientes podem ser escritos como código por um agente de programação a partir de uma imagem ou de um texto, sem exigir criação de assets visuais específicos por cena.

As contribuições declaradas são três: o framework de code worlds com estado editável acoplado a um renderizador neural compartilhado; o método Adversarial Forcing; e um estudo empírico de agentes que evoluem por rodadas.

Contexto: qual problema está sendo atacado

Os autores descrevem um trade-off estrutural na área. Simuladores e engines de jogos oferecem estado explícito, regras programáveis e comportamento verificável, mas ampliar a diversidade visual exige criação massiva de assets 3D e pipelines de renderização complexos.

Cada novo ambiente custa caro para construir e customizar.

Modelos de mundo baseados em vídeo sintetizam observações visuais ricas e interativas a partir de dados. O problema é que, nessas abordagens, o estado relevante para a tarefa e as regras de transição física permanecem implícitos nas histórias geradas e nas representações aprendidas.

Isso impede inspeção direta, edição e teste do comportamento do ambiente, justamente o que se precisa para diagnosticar por que um agente falha.

O que os autores buscam é a combinação de fidelidade (estado, regras e dinâmica consistentes ao longo de interações prolongadas) com realismo (observações que sigam as distribuições visuais do mundo real), e isso através de mundos diversos. Segundo eles, alcançar ambos ao mesmo tempo continua sendo o gargalo.

Como funciona

O renderizador parte do Cosmos 3-Nano, com suas torres de entendimento (UND) e geração (GEN) separadas. A torre UND, congelada, codifica a legenda em chaves e valores consumidos pela GEN.

Um autoencoder de vídeo Wan, também congelado, mapeia RGB e geometria para latentes. A referência de aparência usa a representação nativa de frame limpo do backbone, sem passo de difusão.

As condições estruturadas são profundidade colorizada ou normais de superfície. Profundidade é codificada segundo o mapeamento Vision Banana.

Normais, como vetores unitários em espaço de câmera.

Para vídeo real, os autores obtêm profundidade com ViPE, usando Depth Anything 3 como backend, e normais com NormalCrafter. Cenas simuladas fornecem esses mapas diretamente da geometria, sem exigir materiais detalhados.

Geometria e RGB são concatenados ao longo da dimensão de sequência e processados pelas mesmas camadas Transformer, em joint attention, sem concatenação de canais nem ramos de controle. Isso evita, dizem os autores, um viés indutivo de alinhamento pixel a pixel.

Como geometria estimada de vídeo natural difere da renderizada por engine (vazamento de textura, desalinhamento, oclusões ausentes), o treino aplica retenção aleatória de modalidade, dropout ocasional de ambas, supressão de textura fina por reamostragem, perturbação suave de alinhamento ancorada no primeiro frame e ruído nos latentes de condição.

O treinamento tem três estágios: condicionamento por geometria, adaptação por teacher forcing em blocos causais (com uma cópia limpa representando histórico e uma cópia ruidosa sendo denoised dentro do mesmo Transformer) e, por fim, o Adversarial Forcing.

Neste estágio, o estudante é destilado em poucos passos por distribution matching distillation, na linha do Self Forcing, contra o professor bidirecional.

Duas extensões são destacadas: o exact replay, um escalonamento bloco a bloco que torna o preenchimento do histórico diferenciável com recomputação idêntica bit a bit da trajetória; e um objetivo adversarial com dados reais, com regularização R1/R2 exata para um discriminador de backbone congelado, evitando duplo backward através de kernels de atenção fundidos.

A inferência usa cache de chave-valor limitado e decodificação em streaming. A página do projeto traz material complementar.

Resultados reportados

Os autores relatam um estudo empírico com agentes baseados em modelos de fundação pré-treinados que percebem o mundo exclusivamente por observações renderizadas, diagnosticam falhas e destilam conclusões em "playbooks" escritos, herdados e refinados por rodadas seguintes.

Em hide-and-seek, afirmam que os agentes ancoraram rapidamente conhecimento espacial abstrato em execução física em malha fechada, com uso de rampa e construção de abrigo emergindo em poucos jogos. O mesmo laço reflexivo teria melhorado o desempenho ao longo das rodadas em vários outros ambientes distintos.

O número mais chamativo é o de eficiência de aprendizado: os agentes aprenderam, segundo o paper, a partir de apenas 4 rodadas, em comparação com milhões no contraparte convencional de aprendizado por reforço.

Como novos mundos podem ser escritos como código e renderizados pela mesma interface, os autores argumentam que ambientes podem escalar em número e dificuldade junto com seus agentes.

Limitações e o que não foi provado

O material disponível é generoso em arquitetura e parcimonioso em medição. Não há, no extrato, números de fidelidade visual, métricas de consistência em rollouts longos, latência, resolução ou configuração de hardware por trás da afirmação de "tempo real em uma única GPU".

A comparação com "milhões" de episódios de RL não vem acompanhada de benchmark nomeado, métrica, intervalo de confiança ou descrição do contraparte. É uma afirmação dos autores, não um resultado auditável a partir do que foi apresentado.

A generalização também é mais prometida do que demonstrada. Navegação, manipulação e interação multiagente aparecem na motivação, mas o exemplo concreto destacado é hide-and-seek, com menção genérica a "vários outros ambientes".

Os ganhos atribuídos a playbooks escritos não são decompostos: não se sabe quanto vem de engenharia de prompt, quanto de memória textual e quanto de capacidade real adquirida.

Há ainda dependências encadeadas. O renderizador consome geometria estimada por ViPE, Depth Anything 3 e NormalCrafter, cujos erros podem vazar para a observação apesar das augmentações.

A construção de mundos depende de um agente de programação que levanta máscaras de instância, profundidade monoculares, caixas 3D e malhas de objetos, e depois repara poses, estruturas sem suporte e movimentos ambíguos em laço interativo. A qualidade do mundo é limitada pela qualidade dessa cadeia.

Não há avaliação de robustez, de segurança ou de comportamento fora de distribuição.

Por que isso importa para quem constrói com IA

Para equipes que treinam agentes, a separação entre estado simulável e aparência renderizada resolve dois problemas práticos ao mesmo tempo.

Primeiro, reprodutibilidade e depuração: se o estado não depende da imagem gerada, um mesmo episódio pode ser reexecutado, re-renderizado e inspecionado sob outra câmera, o que é muito difícil em modelos de mundo puramente generativos.

Segundo, custo de conteúdo: deixar materiais e texturas para o renderizador reduz o esforço de autoria por cena, que hoje é o principal freio para escalar ambientes.

As técnicas de treino também são transferíveis para além deste paper. Exact replay para tornar o histórico diferenciável sem custo de memória de um rollout totalmente diferenciável, e regularização adversarial exata sem duplo backward em atenção fundida, interessam a qualquer modelo autorregressivo treinado sobre suas próprias trajetórias: vídeo, mundo, ou política.

A ressalva prática é que o ganho de eficiência prometido é o tipo de resultado que precisa de replicação independente e de números abertos antes de virar decisão de arquitetura.

A direção, porém, é sólida: mundos definidos em código, com verificação explícita de contato, colisão e oclusão, parecem um caminho mais controlável do que confiar exclusivamente a dinâmica a um gerador de vídeo.

Referências

  • AgentGarten: Code Worlds for Evolving Agents — arXiv:2610.12374
  • Página do projeto, mirros-lab.GitHub.io/agent-garten
  • Trabalhos citados pelos autores no extrato: Cosmos 3-Nano; autoencoder de vídeo Wan; ViPE; Depth Anything 3; NormalCrafter; Vision Banana; Self Forcing; distribution matching distillation (DMD); hide-and-seek.

Últimos Artigos

AgentGarten: mundos de código com renderização neural em tempo real
Trace2Env: modelos de mundo agênticos a partir de traces
STEPQuant: quantização espaço-temporal de estados recorrentes
Destilação entre tokenizadores distintos: cobertura não é confiabilidade