Quanyu Long, Xiao Chen, Jianda Chen, Haozhen Zhang, Qisheng Hu, Jianzhu Bao e Wenya Wang assinam From Traces to Agentic Worlds. O artigo propõe uma alternativa à reconstrução de ambientes executáveis para treinar e avaliar agentes baseados em LLMs.
Em vez de reimplementar o sistema original, os autores querem que um agente "modelo de mundo" funcione ele próprio como ambiente. Ele consulta um acervo estruturado de conhecimento derivado de traces históricos.
O framework se chama Trace2Env. É descrito como learning-free e foi avaliado em nove ambientes.
Os autores relatam ganhos na fidelidade da próxima observação prevista e na consistência de interações multi-turno.
O que os autores propõem
A contribuição central é o que os autores chamam de agentic language world modeling. A ideia trata a simulação de ambiente como tarefa agêntica, não como predição única a partir de um prompt fixo.
Nesse desenho, um agente tarefa decide qual ação executar. Um agente modelo de mundo separado determina como o ambiente simulado responde.
O agente modelo de mundo não tem acesso ao sistema original. Ele busca no material derivado dos traces o conhecimento relevante para a interação corrente, combina isso com o estado episódico persistente e a memória episódica, e infere a observação resultante e os efeitos de estado que devem durar.
A instanciação dessa ideia é o Trace2Env. O framework é learning-free e voltado a cenários em que o sistema original é inacessível ou inviável de reproduzir, mas os registros históricos de interação continuam disponíveis.
O framework reconstrói esses traces em um environment worldbook reutilizável, com quatro componentes. O primeiro são esquemas que descrevem a interface de ações e as variáveis de estado representáveis.
O segundo é a evidência fundamentada, que preserva transições registradas e demonstrações. O terceiro são abstrações induzidas, que capturam contratos de observação, invariantes, restrições e efeitos condicionais.
O quarto é a proveniência, que liga cada artefato aos traces e turnos que o sustentam. A página do projeto está em quanyulong.net/trace2env.
Contexto: qual problema está sendo atacado
A motivação parte de uma constatação prática. Agentes interativos dependem de ambientes que respondem a ações e preservam consequências ao longo do tempo.
Replicar um terminal, um workspace de software ou um sistema interno corporativo pode exigir código, dados e infraestrutura indisponíveis.
Interações históricas, por outro lado, costumam permanecer acessíveis. Elas registram ações, observações, falhas e os efeitos de ações anteriores.
Os autores situam o trabalho em duas linhagens. A primeira é a de modelos de mundo em linguagem, que formulam a simulação como predição da próxima observação dado um contexto textual.
Os trabalhos citados são de Li et al. (2026) e Zuo et al.
(2026).
Dentro dessa linha, RAWM (Yang et al., 2025) recupera transições históricas como evidência em contexto. WorldEvolver (Zhang et al., 2026) aumenta um modelo de mundo congelado com memórias episódicas e regras semânticas induzidas de discrepâncias.
Segundo os autores, WorldEvolver pressupõe acesso continuado aos resultados do ambiente original. Isso não vale no cenário apenas-com-traces do Trace2Env.
A segunda linhagem destila estrutura reutilizável a partir de trajetórias. Fazem parte dela Agent Workflow Memory (Wang et al., 2025), Trace2Skill (Ni et al., 2026), Memory–Skill Co-Evolution (Tang et al., 2026), SkillGen (Ma et al., 2026) e TraceCompiler (Yadouni e Li, 2026).
Os autores observam que esses artefatos servem principalmente ao agente tarefa, para decidir como agir, e não para simular o ambiente.
O Terminal-Universe (Wu et al., 2026) compartilha a motivação de reconstruir ambientes a partir de trajetórias. Mas reconstrói workspaces executáveis de terminal, cujo feedback é real.
O Trace2Env constrói um worldbook não executável operado por um modelo de mundo em linguagem.
O problema técnico que organiza o artigo é a continuidade de estado em horizonte longo. Os autores dão um exemplo: apagar report.txt pode não produzir saída informativa, mas um cat report.txt muitos turnos depois deveria retornar erro de arquivo inexistente.
Revisitar observações passadas não basta. O simulador precisa inferir a mudança de estado no momento em que ela ocorre e preservá-la.
Na formulação convencional por prompting, conhecimento de ambiente e histórico de interação são empilhados no mesmo contexto. Isso mistura conhecimento heterogêneo e estado de longo prazo em um prompt achatado.
Como funciona
O Trace2Env opera em duas fases. Na fase offline, um construtor alinha cada ação ao seu resultado e extrai fatos observados, efeitos de estado candidatos, desfechos e incerteza.
A observação original é preservada junto dessa interpretação. Efeitos com atribuição ambígua são deliberadamente omitidos.
A indução de esquemas estabelece um vocabulário comum para ações e estados.
Em seguida, o construtor propõe regras comportamentais e as revisa contra casos de suporte e contraste. Um contraste sucesso–falha pode sugerir uma pré-condição ausente.
Um contraexemplo pode estreitar a regra ou deixá-la como tentativa. Cada artefato derivado mantém referências aos traces e turnos que o sustentam.
O resultado é um pacote imutável, fixado para a simulação online e reutilizado entre rollouts de agentes. Os autores enfatizam que o worldbook não é uma reconstrução executável, mas um recurso comportamental ancorado em traces.
Esse recurso é inspecionável em diferentes níveis de abstração. Um esquema pode identificar um argumento de ação ou campo de estado.
Uma regra pode sugerir um efeito. Uma observação registrada pode fornecer um detalhe que ambos omitem.
Na fase online, para cada ação do agente tarefa, o agente modelo de mundo propõe a observação resultante e as mudanças de estado que devem persistir. Um harness compartilhado verifica e efetiva a transição.
Essa separação permite que o mesmo worldbook sustente múltiplos episódios simulados e diferentes backbones de execução. Cada episódio preserva as consequências de sua própria história.
Formalmente, os autores assumem que a função de transição original, a implementação e o estado oculto estão indisponíveis durante a simulação. Os parâmetros do modelo de mundo permanecem fixos.
O objetivo é aproximar o comportamento observável sob novas sequências de ações.
Resultados reportados
A avaliação é organizada em dois cenários complementares, sobre nove ambientes. No primeiro, de fidelidade da próxima observação em passo único, os autores medem se a resposta simulada corresponde ao ambiente real em cinco dimensões: formato, factualidade, consistência, realismo e qualidade geral.
Segundo o artigo, o Trace2Env melhora todas as cinco em relação ao prompting convencional de modelos de mundo em linguagem.
No segundo cenário, de consistência em interação multi-turno, o teste é comportamental. Ações geradas por um agente tarefa dentro do ambiente simulado são replicadas no ambiente real, e mede-se com que frequência permanecem válidas.
Os autores relatam que as ações geradas contra o Trace2Env se mantêm válidas com mais frequência na replicação real. Na leitura deles, isso indica que a dinâmica simulada preserva melhor as consequências de ações anteriores ao longo de turnos sucessivos.
O material disponível não oferece números absolutos, tamanhos de amostra, intervalos de confiança, quebra por ambiente nem detalhamento do protocolo de julgamento usado nas cinco dimensões. As comparações quantitativas precisam ser lidas no artigo completo.
Limitações e o que não foi provado
O próprio desenho impõe limites. O framework é learning-free e mantém os parâmetros do modelo de mundo fixos.
O teto de qualidade depende do backbone escolhido e da cobertura dos traces. Ambientes sem histórico de interação ficam fora do escopo.
Como o worldbook não é executável, ele não gera efeitos colaterais reais nem feedback de ferramentas. A fidelidade fica restrita ao comportamento observável registrado e às abstrações induzidas a partir dele.
Há também riscos de completude. Efeitos com atribuição ambígua são retidos, e regras sem casos de contraste podem permanecer tentativas.
Isso cria lacunas potenciais justamente em transições menos documentadas.
A proveniência amarra cada artefato à sua evidência, mas a qualidade do worldbook herda a qualidade e o viés dos traces de origem.
Do lado empírico, os autores demonstram ganhos relativos sobre prompting convencional, não equivalência ao ambiente original. A avaliação cobre nove ambientes, mas o material não especifica a extensão dos horizontes multi-turno testados nem a diversidade de domínios.
Também não informa se há análise estatística dos ganhos.
Não há, no extrato, evidência sobre custo computacional ou latência do agente modelo de mundo em runtime, fator relevante para uso em escala. E não se estabelece comparação direta com reconstruções executáveis como o Terminal-Universe, já que os objetivos declarados são distintos.
Por que isso importa para quem constrói com IA
Para equipes que desenvolvem agentes, o artigo oferece uma lição arquitetural antes de oferecer um produto. A separação entre conhecimento de ambiente, estado episódico e memória conversacional responde a um problema recorrente: prompts achatados degradam à medida que o histórico cresce.
Externalizar o conhecimento do ambiente em um recurso estruturado, que um agente consulta seletivamente, é o mesmo padrão que aparece em memória de agentes e em recuperação aumentada. Aqui ele é aplicado ao lado do ambiente, e não ao lado da tarefa.
O segundo ponto é o controle explícito de transições. O harness que verifica e efetiva mudanças de estado separa uma simulação com estado persistente de uma sequência de respostas plausíveis.
Para quem testa políticas de agentes, isso importa: sem commit explícito de efeitos, consequências como um arquivo apagado se perdem e o multi-turno vira teatro.
Há aplicações concretas plausíveis em contextos corporativos brasileiros, onde sistemas internos raramente são reprodutíveis fora da produção. Usar logs de operação como traces para construir um simulador de ambiente permite avaliar regressões de política de agente sem tocar o sistema real.
Mas três cuidados se impõem. Primeiro, tratar a observação simulada como hipótese, não como verdade: a replicação no ambiente real continua sendo o teste de validade.
Segundo, monitorar deriva em episódios longos, já que regras tentativas e efeitos retidos podem acumular erro. Terceiro, governança: traces de sistemas internos costumam conter dados sensíveis, e o material consultado não discute anonimização, retenção ou controle de acesso ao worldbook.
Como direção de pesquisa, o artigo reposiciona a pergunta. Em vez de "como reconstruir o sistema?", os autores perguntam "quanto do comportamento observável pode ser recuperado apenas do que já foi registrado?".
É uma aposta conservadora que troca fidelidade executável por viabilidade. Segundo os próprios resultados relatados, ainda assim melhora a consistência de interações longas.
Referências
- LONG, Quanyu; CHEN, Xiao; CHEN, Jianda; ZHANG, Haozhen; HU, Qisheng; BAO, Jianzhu; WANG, Wenya. From Traces to Agentic Worlds: Agentic Language World Models for Interactive Environment Simulation. arXiv:2610.06100, 2026. Disponível em: https://arxiv.org/abs/2610.06100
- Página do projeto Trace2Env: https://quanyulong.net/trace2env/
- Trabalhos citados pelos autores e discutidos acima: Li et al. (2026) e Zuo et al. (2026) sobre modelos de mundo em linguagem; Yang et al. (2025), RAWM; Zhang et al. (2026), WorldEvolver; Wu et al. (2026), Terminal-Universe; Wang et al. (2025), Agent Workflow Memory; Ni et al. (2026), Trace2Skill; Tang et al. (2026), Memory–Skill Co-Evolution; Ma et al. (2026), SkillGen; Yadouni e Li (2026), TraceCompiler.




