Um grupo de mais de trinta pesquisadores apresenta o WROP (World Reasoning with Object Permanence). Haotian Zhang, Fengyuan Yu e Dezhi Luo encabeçam o trabalho.
É uma infraestrutura de dados e avaliação construída em Blender. Mede e treina duas capacidades que a ciência cognitiva do desenvolvimento trata como fundacionais: permanência de objeto (OP) e solidez (OS).
O argumento central é que objetos que somem atrás de oclusores não são artefatos visuais cosméticos. Reaparecer em posições impossíveis ou atravessar barreiras sem desvio também não.
São falhas estruturais que contaminam qualquer raciocínio físico rio abaixo. São 150 geradores, um corpus de 1,5 milhão de amostras e um exame fixo de 300 questões.
Os autores pós-treinam o PWM-WROP, um world model de 16B de parâmetros, e o colocam no topo entre modelos de continuação em um estudo cego de preferência humana.
O que os autores propõem
O paper, disponível em arXiv.org/abs/2609.28654, entrega quatro artefatos declarados pelos autores. O primeiro é um benchmark cognitivamente fundamentado: 150 geradores Blender escritos à mão, organizados em seis famílias de tarefas (três sondando permanência de objeto, três sondando solidez), com metadados de trajetória por amostra, estado de cena e um exame fixo de 300 perguntas.
O segundo é o corpus de treino de 1,5 milhão de amostras, gerado com 10.000+ amostras por tarefa. O terceiro é o PWM-WROP, um modelo de continuação de 16B pós-treinado nesse corpus.
O quarto é a pilha de engenharia: PWM, um stack de treino em PyTorch nativo rodando em AWS Trainium2, liberado junto com pesos, respostas do modelo, pontuações e dados.
A página do projeto, object-permanence.world, reúne o material liberado.
Contexto: qual problema está sendo atacado
A tese de fundo é que modelos de geração de vídeo viraram candidatos naturais a world models. Sora, MovieGen, Veo 3.1, Kling 2.6, Wan2.2, HunyuanVideo, CogVideoX-1.5 e LTX-2 são citados como evidência de fidelidade perceptual e coerência temporal.
Mas, segundo os autores, persiste um fracasso característico: a física elementar de identidade e impenetrabilidade.
Eles ancoram o argumento na literatura de core knowledge. Bebês representam objetos ocluídos já aos 3,5 meses (Baillargeon, 1986); registram violações de solidez no primeiro semestre de vida (Baillargeon et al., 1985; Hespos e Baillargeon, 2001).
Baillargeon (1985), Hood et al. (2000) e Saxe et al.
(2006) mostram que essas restrições guiam previsões sobre remoção de suporte e agentes animados. Piaget (1954) tratava a permanência como a conquista cognitiva definidora do estágio sensoriomotor.
Spelke e Kinzler (2007) classificam OP e OS como a camada mais primitiva do sistema de core knowledge.
Os autores apontam três lacunas nos benchmarks existentes: cobertura predominantemente 2D; avaliações restritas a image-to-video, sem o regime video-to-video (V2V); e ausência de avaliação dedicada a inferência física estruturada. A limitação mais consequente, argumentam, é o uso disseminado de juízes baseados em VLMs.
Modelos multimodais exibiriam déficits sistemáticos de core knowledge (Li et al., 2025), falhariam em raciocinar sobre transformação física (Luo et al., 2026) e não teriam constância perceptual confiável (Sun et al., 2025).
Como funciona
As seis famílias são adaptadas de paradigmas experimentais estabelecidos. Em OP-1 (Baillargeonian_Occlusion), um objeto percorre uma trajetória e passa atrás de um oclusor; o modelo precisa gerar a reemergência no lado distal com identidade, tamanho e direção intactos.
Em OP-2 (Object_Static_Occlusion), um oclusor móvel cobre uma configuração estática e, ao ser removido, a cena deve ser reinstaurada sem alteração de número, identidade ou arranjo. Em OP-3 (Container_Permanence), o objeto é escondido em um recipiente que pode se deslocar, girar ou ser trocado por outro, e a localização precisa ser recomputada em relação ao referencial móvel.
Do lado da solidez, OS-1 (Baillargeonian_Obstruction) exige avaliar se a abertura de uma barreira é menor (bloqueio) ou maior (passagem) que o objeto; OS-2 (Object_Drop) retira o suporte e decide se o objeto cai e se atravessa um filtro de tamanho abaixo.
O desenho experimental separa dois tipos de parâmetro. Os estruturais definem o desafio cognitivo: número de objetos, geometria, trajetória, configuração de oclusão, tamanho de abertura, tempo de contato.
Variam sistematicamente para impedir memorização de um desfecho físico fixo. Os de superfície são randomizados independentemente: cor, material, iluminação, ponto de câmera.
Assim o modelo não explora pistas perceptuais em vez de raciocínio físico.
Cada clipe de referência é cortado no evento físico chave: metade como contexto de entrada, metade como alvo a ser gerado. As continuações são julgadas por humanos contra animações de referência autorais fisicamente consistentes, e não por VLMs.
O protocolo de avaliação é um estudo pareado cego com 20 avaliadores, usando ratings Bradley–Terry na escala Elo com intervalos de confiança bootstrap agrupados por avaliador. Os 14 modelos avaliados cobrem três classes de interface: 3 reference-to-video, 7 de edição e 4 de continuação.
Resultados reportados
Segundo os autores, o PWM-WROP alcança Elo 1679,5 e fica em primeiro lugar entre os modelos de continuação, além de terceiro no geral. Fica atrás apenas de um empate estatístico entre dois sistemas comerciais reference-to-video em 1723,6.
O resultado é obtido com resolução nativa de 320×192, contra 720p e 1080p dos concorrentes. Em resolução pareada, os autores relatam que o PWM-WROP obtém os melhores valores de LPIPS e MS-SSIM contra o vídeo alvo.
Todo o material é liberado: dados, exame, respostas do modelo, pontuações, pesos e a pilha PWM.
Limitações e o que não foi provado
O material disponível não sustenta conclusões além do que foi medido. Primeiro, o domínio é sintético: todos os 150 geradores são renderizações Blender.
Não há evidência apresentada de transferência para vídeo real, para robótica ou para qualquer tarefa fora do exame de 300 questões. Segundo, o exame tem duas perguntas por gerador e o estudo humano usa 20 avaliadores.
É escala pequena para afirmações fortes sobre ranking, ainda que o intervalo bootstrap agrupe por avaliador.
Terceiro, o resultado principal é um primeiro lugar entre modelos de continuação e um terceiro lugar geral. Os autores descrevem os dois sistemas comerciais reference-to-video como estatisticamente empatados entre si, o que significa que a comparação direta com o topo da tabela não foi resolvida.
Quarto, o PWM-WROP opera em 320×192 nativo, uma ordem de grandeza abaixo dos concorrentes em resolução. É plausível como escolha de eficiência, mas também um limite de aplicabilidade prática que o resumo não discute.
Quinto, o paper mede OP e OS, não raciocínio causal de alto nível. Os próprios autores afirmam que colisão e remoção de suporte herdam erros de interpenetração, mas isso é uma hipótese estrutural, não um resultado demonstrado sobre tarefas downstream.
Também não há, no extrato disponível, evidência sobre esquecimento catastrófico após o pós-treino nem sobre generalização a tarefas físicas não vistas. Um detalhe editorial: a seção de trabalhos relacionados se refere ao benchmark como "VR-OP&S" em um trecho, enquanto o restante do material usa WROP.
É uma inconsistência de nomenclatura que vale acompanhar na versão final.
Por que isso importa para quem constrói com IA
Para quem desenvolve agentes, pipelines de vídeo ou sistemas que precisam prever consequências físicas, a mensagem prática é que permanência de objeto é uma dependência upstream. Um modelo que permite interpenetração não vai gerar colisões válidas nem remoção de suporte correta, e camadas superiores herdam o erro.
Tratar isso como capacidade treinável, e não como propriedade emergente que aparece sozinha ao escalar, muda o desenho do pipeline de dados.
O aspecto mais reaproveitável do trabalho talvez seja metodológico: geradores paramétricos que separam dificuldade estrutural de variação superficial, um exame congelado e julgamento humano em vez de juiz VLM. Para equipes que constroem avaliações de domínio, é um molde replicável, mesmo que caro.
E a liberação do corpus com trajetórias e metadados de estado de cena, mais o stack PWM em Trainium2, reduz o custo de entrada de quem quer testar a hipótese em outro domínio, ou contestá-la.
Referências
- Zhang, H.; Yu, F.; Luo, D. et al. Training Object Permanence in World Models. arXiv:2609.28654. Disponível em arXiv.org/abs/2609.28654.
- Página do projeto e material liberado: object-permanence.world.
- Baillargeon, R. (1986); Baillargeon, R. et al. (1985); Hespos, S. e Baillargeon, R. (2001); Hood, B. et al. (2000); Spelke, E. e Kinzler, K. (2007); Piaget, J. (1954) — base cognitiva citada pelos autores.
- Li et al. (2025); Luo et al. (2026); Sun et al. (2025), déficits de core knowledge e constância perceptual em modelos multimodais, conforme citados no paper.




