RealCompanion: benchmark com conversas reais expõe limites da memória de IA

shape
shape
shape
shape
shape

RealCompanion: benchmark com conversas reais expõe limites da memória de IA

RealCompanion: benchmark com conversas reais expõe limites da memória de IA

O paper RealCompanion, de Arman Behnam, Sunglyoung Kim e Liangwei Yang, reúne dez relacionamentos reais entre pessoas e um companheiro de IA. São 27.218 mensagens ao longo de até 120 dias.

A partir delas, os autores propõem um benchmark para medir se um sistema entende quem conversa com ele.

Os autores argumentam que os modelos atuais falham em três frentes. Não sabem quando o passado importa.

Não alcançam memórias distantes. Projetam sobre o usuário traços que ele nunca revelou.

O achado central é que "entender uma pessoa" depende de saber quando o passado é relevante e onde termina o que ela compartilhou.

O que os autores propõem

Os autores propõem um benchmark de compreensão humana baseado em conversas reais e longitudinais, não em diálogos sintéticos gerados para testar memória. Para cada um dos dez participantes, o corpus libera cinco arquivos.

São eles: a conversa completa, um perfil com o que a pessoa declarou, uma persona com a leitura de como ela pensa, sente e decide, itens de chat com respostas de referência e itens de pergunta escritos a partir do perfil. Cada rótulo aponta para as mensagens que o sustentam.

Cada item de chat vem acompanhado do raciocínio que o produziu.

O conjunto se organiza em três trilhas de avaliação. A trilha de reconstrução pede que um sistema devolva o perfil e a persona.

A trilha de chat pontua respostas às mensagens reais da pessoa. A trilha de perguntas pontua respostas a perguntas escritas, com 3.312 itens distribuídos em 16 categorias.

A ideia é tornar mensuráveis quatro desafios que, segundo os autores, os benchmarks anteriores resolvem de antemão: saber quando o passado importa, saber o que as mensagens somam, recorrer a tudo ao mesmo tempo e verificar se o resultado está certo. Os autores também definem sete condições que um corpus precisa cumprir para medir a tarefa, descritas no Apêndice A do paper.

Contexto: qual problema está sendo atacado

A linha de pesquisa em memória conversacional se consolidou em torno de um formato único. Constrói-se um histórico longo, faz-se uma pergunta ao final e mede-se se o sistema recupera o fato que a pergunta exige.

Benchmarks como LoCoMo (Maharana et al., 2024) e LongMemEval (Wu et al., 2024), que escala o contexto para além de um milhão de tokens, seguem esse desenho. CloneMem (Hu et al., 2026) vai a diários e mensagens gerados a partir de perfis Big Five.

O problema, segundo os autores, é que esse formato decide uma coisa no lugar do sistema. A pergunta já diz o que deve ser recuperado, então o benchmark nunca precisa julgar se a recuperação era necessária.

Benchmarks que testam seleção diretamente, como CUPID (Kim et al., 2025) e HorizonBench (Li et al., 2026b), relatam o quão difícil isso é. Nenhum modelo avaliado pelo CUPID ultrapassa 50% de precisão ao identificar de qual contexto anterior um pedido depende.

Todos os 25 modelos avaliados pelo HorizonBench selecionam desproporcionalmente o valor anterior à mudança de preferência.

No terreno específico de companheiros, ANCHOR (Venkit et al., 2026b) avalia se o agente permanece ele mesmo ao longo de 2.008 conversas e 27 personas. Reporta acurácia de trajetória de 44,4% e recall do estado do usuário próximo do aleatório.

CompanionBench (Liu et al., 2026), que parte de conversas reais de companheiros, afirma que uma sessão de 20 turnos não alcança a profundidade de revelação que se desenvolve em um relacionamento mais longo.

Esforços mais recentes removem a substituição nos dados. AlpsBench (Xiao et al., 2026) reúne 2.500 sequências longas do WildChat e avalia sete sistemas de memória.

PRISM (Kirk et al., 2024) coleta feedback de 1.500 pessoas. OmniBehavior e LUNAR partem de traços comportamentais reais fora da conversa (Chen et al., 2026b; Zhang et al., 2026a).

Ainda assim, os autores argumentam que falta um corpus em que as conversas não tenham sido escritas para testar um sistema.

Como funciona

O corpus vem do armazenamento operacional de um aplicativo de companheiro. Cada mensagem liberada está onde o participante a enviou.

A liberação é totalmente anonimizada: cada mensagem foi reescrita e identificadores diretos foram substituídos por substitutos consistentes, preservando o que a pessoa disse, por que disse e a que contexto respondia. Ninguém foi recrutado para um protocolo.

O corpus registra o uso diário de um produto.

Toda etiqueta do corpus teve de ser derivada, e os autores insistem que uma etiqueta derivada só merece confiança se cada passo puder ser conferido. Os itens de chat têm probes que são mensagens reais do usuário, uma resposta de referência escrita sob o contexto registrado e um traço de raciocínio.

Esse traço nomeia o que a pessoa estava apontando, onde isso vive, de quais mensagens a resposta foi construída e se essas mensagens a sustentam.

Os itens são classificados em quatro tiers conforme o contexto permitido: apenas mensagens precedentes (basic), uma alegação do perfil (intermediate), uma troca anterior (hard) e contexto vazio (edge). O tier pode ser recalculado a partir das listas.

O perfil registra o que a pessoa declarou, com as mensagens que sustentam cada alegação, uma confiança e a janela em que aquilo valeu. A extração é adversarial em relação à própria saída e descarta mais de um terço do que propõe.

A persona, sem equivalente em trabalhos anteriores segundo os autores, guarda cada leitura da pessoa com as mensagens por trás, uma força declarada e hipóteses de trabalho nomeadas com seus fundamentos.

Resultados reportados

Três achados se destacam. Primeiro, as pessoas raramente se referem ao passado.

Apenas 3,4% das mensagens dependem de algo dito antes. Quando isso acontece, a mensagem anterior está, em mediana, 2.157 mensagens atrás.

Médias escondem esse fenômeno. Buscar nas mensagens mais recentes encontra a mensagem necessária em 95,9% dos casos no geral, mas só em 2,2% quando ela está distante.

Segundo, os sistemas não sabem dizer quando o passado importa. Os detectores testados mal superam o acaso em mensagens reais.

E quando as mesmas mensagens anteriores são rotuladas de "memórias" em vez de "mensagens anteriores", os modelos trazem o passado de 10 a 14 pontos percentuais a mais, mesmo quando nada do passado é necessário.

Terceiro, os sistemas leem mais sobre uma pessoa do que ela revelou. Três sistemas de agente reconstroem cada persona igualmente bem (F1 0,71).

Segundo os autores, eles veem a pessoa e então imaginam o resto. O corpus também reporta que a derivação foi feita por modelos e auditada por pessoas, com a concordância divulgada no Apêndice D.

Limitações e o que não foi provado

O próprio desenho impõe limites. São dez pessoas, e dois relacionamentos concentram 73% de todas as mensagens, quase três vezes mais que os outros oito somados.

A profundidade não se acumula entre sujeitos: cada participante é uma instância autocontida, com seus cinco arquivos, e os oito relacionamentos mais curtos refletem um uso mais leve. Os resultados precisam ser lidos por pessoa, não como uma amostra representativa.

Os autores também observam que as pessoas contam sobre família, saúde e preocupações, mas quase nunca declaram sua categoria censitária. Isso significa que o corpus registra apenas o que esses dez revelaram, e a generalização para outros perfis não está estabelecida.

Toda etiqueta derivada depende de uma cadeia de decisões automatizadas, ainda que auditada. Os autores mantêm no corpus as alegações que falharam na auditoria justamente para que a auditoria possa ser auditada, mas isso não elimina o risco de erro sistemático.

Por que isso importa para quem constrói com IA

Para times que constroem agentes de memória, RAG ou aplicações de companheiro, o paper desloca o foco. A pergunta deixa de ser "meu sistema recupera o fato certo quando perguntado?" e passa a ser "meu sistema sabe quando deve recuperar algo?".

Os números sugerem que, em conversas reais, o passado raramente importa. Isso torna um sistema que sempre busca contexto caro e, pior, propenso a respostas ancoradas em coisas que a pessoa não pediu.

O achado sobre rótulos é especialmente prático. Chamar mensagens antigas de "memórias" faz os modelos evocarem o passado com mais frequência, mesmo sem necessidade.

Para quem escreve prompts ou projeta camadas de memória, é um sinal de que a nomenclatura interna do sistema influencia o comportamento. E a reconstrução de persona com F1 de 0,71 em três sistemas diferentes indica que hoje os agentes tendem a preencher lacunas com suposições plausíveis, não com o que a pessoa de fato disse.

O corpus está disponível para consulta, com dados em osf.io/x25kj e código em anonymous.4open.science/r/realcompanion-54CC.

Referências

  • Behnam, A.; Kim, S.; Yang, L. RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations. arXiv:2610.01780, 2026.
  • Maharana et al. LoCoMo, 2024.
  • Wu et al. LongMemEval, 2024.
  • Hu et al. CloneMem, 2026.
  • Kim et al. CUPID, 2025.
  • Li et al. HorizonBench, 2026b.
  • Venkit et al. ANCHOR, 2026b.
  • Liu et al. CompanionBench, 2026.
  • Xiao et al. AlpsBench, 2026.
  • Kirk et al. PRISM, 2024.
  • Chen et al. OmniBehavior, 2026b.
  • Zhang et al. LUNAR, 2026a.

Últimos Artigos

RealCompanion: benchmark com conversas reais expõe limites da memória de IA
Dobramento de proteínas melhora raciocínio geral em LLMs, dizem autores
On-policy ou off-policy? O que decide o resultado na destilação de LLMs
OneStreamer: memória e resposta proativa em vídeo contínuo