ReaLVR: ancorando o raciocínio latente em evidência visual

shape
shape
shape
shape
shape

ReaLVR: ancorando o raciocínio latente em evidência visual

ReaLVR: ancorando o raciocínio latente em evidência visual

Modelos multimodais que raciocinam em espaço latente produzem estados contínuos em vez de palavras intermediárias. Esses modelos não preservam de forma confiável a evidência visual que determina a resposta.

Essa é a constatação central do paper "Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence". O trabalho é assinado por Xi Xiao, Tianchen Zhao, Youngeun Kim, Zhuowei Li e mais nove coautores.

Os autores identificam o que chamam de latent evidence-credit gap. Propõem o ReaLVR, um método que traz supervisão de evidência visual para as trajetórias latentes que o próprio modelo gera.

O método não altera arquitetura nem procedimento de inferência.

O que os autores propõem

O ReaLVR ("Outcome-Contrastive Evidence Credit") combina duas fontes de sinal sobre uma única trajetória latente diferenciável, produzida pelo modelo corrente.

O contraste entre resposta correta e respostas erradas geradas pelo próprio modelo decide onde aplicar supervisão mais forte. O contraste entre evidência visual relevante e evidência desemparelhada decide o que aquelas posições devem preservar.

Segundo o paper, o método não muda a arquitetura do MLLM nem o procedimento de inferência. É uma camada adicional de supervisão durante o treino.

Os autores apresentam três contribuições. A primeira é a caracterização do latent evidence-credit gap, com evidência comportamental e de representação de que o LVR convencional não retém evidência visual relevante para a resposta ao longo da trajetória gerada.

A segunda é o ReaLVR propriamente dito. A terceira é uma avaliação com seis backbones de três famílias, chegando a 235 bilhões de parâmetros.

Os autores descrevem essa avaliação como a primeira demonstração de treino de raciocínio visual em espaço latente em escala de fronteira.

Contexto: qual problema está sendo atacado

Raciocínio visual latente (LVR) surgiu como alternativa ao chain-of-thought textual em MLLMs. Em vez de escrever cada passo em palavras, o modelo insere tokens latentes contínuos entre a entrada e a resposta.

São estados ocultos do decoder, realimentados diretamente, sem passar pelo vocabulário.

A proposta é atraente para problemas de relações espaciais e detalhes visuais finos, difíceis de descrever verbalmente. O problema é que, ao contrário do CoT textual, esse raciocínio não é observável.

O treino padrão de LVR tem dois estágios. No primeiro (SFT), os estados latentes são supervisionados por teacher forcing a reconstruir alvos visuais derivados de anotações de região (ROI).

No segundo, o modelo passa a gerar uma trajetória livre e é pós-treinado com GRPO.

A questão apontada por Xi Xiao e coautores é que o GRPO só otimiza o texto gerado. Os vetores latentes amostrados são tratados como contexto fixo durante o replay da política, e o gradiente não retropropaga pelo processo que os produziu.

A recompensa de resposta final não informa quais posições latentes precisam de mais supervisão nem que evidência deveriam carregar. Os autores testam essa hipótese com perturbações de imagem que alteram a resposta correta.

Observam que os tokens latentes respondem apenas fracamente. Daí a expressão "lacuna de crédito de evidência latente".

Como funciona

O ReaLVR parte de um princípio de on-policy distillation: supervisionar trajetórias produzidas pelo próprio aprendiz, não por um prefixo fornecido. Para cada exemplo, o modelo regenera uma trajetória latente realimentando recursivamente seus próprios estados ocultos.

Os autores mantêm o gradiente através dessa recorrência. Assim, a perda de evidência atualiza o processo que gera os tokens latentes, e não apenas os estados já amostrados.

A definição do alvo visual usa a anotação de ROI para construir uma máscara sobre os tokens visuais. O protótipo positivo é a média mascarada desses tokens.

Quando não há ROI ou a máscara é vazia, o alvo passa a ser a imagem inteira.

Para tornar o alvo discriminativo, os autores formam um conjunto de protótipos negativos a partir de exemplos desemparelhados. Em cada posição latente, definem uma margem: a similaridade de cosseno com o protótipo relevante menos a maior similaridade com qualquer negativo.

O encoder de visão e o conector ficam congelados, mantendo os protótipos fixos enquanto o modelo de linguagem aprende a preservar seu conteúdo.

A localização da supervisão vem da atenção. A partir das compleções amostradas pela política de comportamento, os autores selecionam respostas erradas distintas e parseáveis.

Essas respostas candidatas são forçadas por teacher forcing após o span latente. A atenção pós-softmax dos tokens de conteúdo da resposta canônica sobre cada posição latente é subtraída da atenção observada nas respostas erradas, com média sobre camadas, cabeças e tokens de conteúdo.

Posições onde a resposta correta "lê" mais do que as alternativas erradas recebem peso maior. A intuição é descartar a atenção compartilhada entre desfechos concorrentes e concentrar o sinal onde há crédito real.

Todo o span latente é gerado antes de qualquer token de resposta. Correta e erradas são injetadas depois, em ramos separados, sobre o mesmo span compartilhado.

Uma única trajetória diferenciável serve às duas fontes de supervisão. A página do projeto com figuras e detalhes adicionais está em xixiaouab.GitHub.io/projects/ReaLVR.

Resultados reportados

Os autores avaliam cinco benchmarks com seis backbones de três famílias: Qwen2.5-VL / Qwen3-VL, InternVL3 e Gemma-3.

Em Qwen2.5-VL-7B, o ReaLVR atinge a maior média de cinco tarefas entre os métodos de raciocínio latente avaliados: 63,7%.

Em Qwen3-VL-8B, os autores afirmam que o método supera os baselines de raciocínio latente avaliados. O extrato disponível não traz o número exato.

Em Qwen3-VL-30B, chega a 65,2%, 1,1 ponto acima do LVR.

Em Qwen3-VL-235B, melhora sobre o LVR-SFT nos três benchmarks avaliados. Os autores apresentam o resultado como o primeiro treino de raciocínio visual latente em um backbone multimodal de 235 bilhões de parâmetros.

As análises qualitativas também são relevantes. Os autores relatam posições de tokens latentes mais sensíveis à pergunta, alinhamento mais forte com as regiões visuais relevantes e maior dependência de contexto fixo nos tokens latentes que recebem mais atenção.

Esse último ponto rebate a hipótese de colapso: os estados latentes continuam dependentes da entrada e carregam informação relevante para a resposta, em vez de convergir para uma trajetória fixa. O artigo completo está no arXiv.

Limitações e o que não foi provado

O material disponível não traz uma seção explícita de limitações. Algumas ressalvas decorrem do próprio desenho.

A hipótese causal não é provada. Os autores atribuem a lacuna à ausência de supervisão explícita no GRPO, mas a evidência apresentada é comportamental e de representação. Reduzir essa lacuna com supervisão adicional é consistente com a hipótese, não uma demonstração isolada dela.

Dependência de anotação de região. O alvo positivo vem de ROI quando disponível. Sem ROI, recai na imagem inteira, o que é menos discriminativo.

O ganho do método pode variar com a qualidade e a cobertura das anotações.

Atenção como proxy de crédito. O roteamento de posições usa atenção pós-softmax média sobre camadas e cabeças como sinal de "quem lê o quê". É um proxy conhecido por ser ruidoso e não necessariamente causal.

Negativos de exemplos desemparelhados. A discriminabilidade do alvo depende do conjunto de protótipos negativos amostrados. Não há análise reportada sobre sensibilidade a esse tamanho ou à estratégia de amostragem.

Custo de treino. Regenerar a trajetória do modelo com gradiente através da recorrência e calcular atenção em múltiplos ramos adiciona custo computacional e de memória que o extrato não quantifica.

Cobertura de avaliação. Cinco benchmarks e seis backbones é uma base razoável, mas o teste em 235B cobre apenas três benchmarks. Os autores não demonstram que os ganhos se mantenham em tarefas fora do conjunto avaliado.

Por que isso importa para quem constrói com IA

Se você treina modelos multimodais com GRPO, a mensagem prática é desconfortável: recompensa de resposta final é um sinal pobre para supervisionar o processo interno. Em raciocínio textual isso é mitigado pela legibilidade dos passos intermediários.

Em raciocínio latente, não há nada para inspecionar.

Um modelo pode acertar por atalhos, como viés de formato ou correlações espúrias do dataset, sem que a trajetória latente carregue a evidência visual que justifica a resposta.

Para aplicações em produção que dependem de inspeção visual, como laudos, checagem documental e análise de imagens técnicas, isso é risco direto de confiabilidade.

O ReaLVR interessa porque ataca o problema no treino, sem tocar na inferência. O custo de adoção é de pipeline de treino, não de latência ou de reescrita do runtime.

E o resultado em 235B sugere que a abordagem não é um truque que se dissolve com escala.

Há também um argumento de eficiência. Se o raciocínio latente consegue preservar evidência visual de forma confiável, ele oferece o caminho mais barato que o CoT textual em tokens: menos tokens gerados, menos chamadas de decodificação.

O que faltava era justamente a garantia de que o caminho barato não é o caminho errado.

O trabalho de Xi Xiao e coautores é uma contribuição nessa direção. O pedido final dos autores é explícito: olhar para a dinâmica interna do raciocínio contínuo, não apenas para a acurácia nos benchmarks.

Referências

  • XIAO, Xi; ZHAO, Tianchen; KIM, Youngeun; LI, Zhuowei; XU, Linghan; WU, Jiaye; ZHANG, Zheng; XU, Xiang; CHEN, Xuanbai; TEJANI, Farhan; ZABLOCKI, Jakub; XU, Julia; XING, Yifan. Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence. arXiv:2609.34563, cs.CV, 2026. Disponível em: https://arxiv.org/abs/2609.34563
  • Página do projeto ReaLVR: https://xixiaouab.github.io/projects/ReaLVR/

Últimos Artigos

ReaLVR: ancorando o raciocínio latente em evidência visual
RIDE: extrapolar a direção induzida por RL na destilação on-policy
Raven: o "harness de harnesses" para agentes de IA composáveis
FuseReg: regularização de fusão de camadas em RAEs