OneStreamer: memória e resposta proativa em vídeo contínuo

shape
shape
shape
shape
shape

OneStreamer: memória e resposta proativa em vídeo contínuo

OneStreamer: memória e resposta proativa em vídeo contínuo

Em vídeo contínuo, o modelo precisa decidir o que vale a pena registrar antes de saber qual pergunta virá depois. O OneStreamer, proposto por Xiangyu Zeng, Yuandong Yang, Zhiqiu Zhang e um extenso grupo de coautores, trata essa decisão e a resposta ao usuário como um único processo generativo.

O mesmo mecanismo que narra evidências em texto também decide quando falar.

Segundo os autores, o modelo de 4B lidera os oito benchmarks de vídeo em streaming avaliados. O esquema de supervisão proposto usa apenas 27,5% dos tokens de estado anotados.

O trabalho está no arXiv e tem página de projeto com 29 páginas, 12 figuras e 20 tabelas.

O que os autores propõem

O OneStreamer é apresentado como um LLM de vídeo em streaming que unifica gravação de evidências e resposta a tarefas por meio de um processo de geração causal compartilhado. A tese central dos autores é que a geração proativa pode ter um papel maior do que produzir saídas visíveis ao usuário.

Ela seria a interface de aprendizado que conecta percepção visual, formação de memória factual e resposta tempestiva.

Três componentes sustentam a proposta. O primeiro é a Proactive Hierarchical Caption Memory (PHCM), que produz registros textuais alinhados no tempo em dois níveis: legendas locais e densas de objetos, ações, cenas e mudanças de estado, e sumários semânticos mais esparsos de eventos concluídos.

O segundo é o Proactive State Transition Learning (PSTL), que reduz a dominância de estados repetidos de espera na função de perda. O terceiro é um pipeline reutilizável de síntese de dados de streaming, que converte recursos de vídeo offline em sequências de treino com conteúdo e timing alinhados à evidência disponível.

Desse pipeline, combinado a dados open-source limpos em formato comum, resulta o OneStreamer-1M, descrito pelos autores como um corpus de interação com vídeo em streaming de ampla cobertura, com mais de um milhão de registros.

Contexto: qual problema está sendo atacado

Vídeo do mundo real chega como um fluxo aberto de observações. Em assistentes de transmissão ao vivo, agentes vestíveis e sistemas de monitoramento de segurança, o modelo precisa interpretar evidência visual sem saber quais observações importarão para tarefas futuras.

Um evento que parece irrelevante pode se tornar relevante depois que seus quadros-fonte já saíram da janela visual limitada. A resposta precisa ser entregue antes que o momento passe.

Os autores organizam a literatura em três frentes com limitações complementares. Mecanismos de memória que comprimem ou recuperam evidência visual distante estendem o histórico acessível, mas tokens visuais históricos retidos competem com observações recentes por capacidade de contexto limitada, o que pode enfraquecer a percepção em tempo real.

Métodos de "streaming thinking" mantêm raciocínio em evolução, mas as traças de raciocínio não constituem necessariamente registros factuais ancorados no tempo e reutilizáveis. Já o controle de resposta baseado em tokens de estado viabiliza saídas proativas, porém a supervisão densa desses tokens pode enfatizar excessivamente rótulos repetidos de silêncio em relação a decisões esparsas de resposta.

Daí a pergunta que guia o paper: como um LLM de vídeo em streaming pode transformar observações recebidas em memória factual reutilizável para respostas tempestivas, sem comprometer a percepção em tempo real?

Como funciona

O modelo processa o fluxo como clipes ordenados temporalmente. Um encoder visual extrai tokens de cada clipe e um projetor os mapeia para o espaço de embeddings do LLM.

Uma janela deslizante Recent-FIFO mantém apenas os tokens visuais dos quadros mais recentes, intercalados a um histórico de texto que acumula registros de legenda e diálogo. A sequência causal visual-linguagem contém, portanto, apenas informação disponível no instante corrente.

Tokens de controle específicos por tarefa sinalizam o comportamento. </Observe> introduz uma legenda local detalhada; </Summary> introduz um sumário semântico de evento concluído; </Standby> indica que evidência relevante está emergindo mas a resposta ainda não é possível; </Response> libera a saída visível ao usuário; e </Silence> indica observação continuada sem gerar legenda ou resposta. Os dois primeiros tipos formam a hierarquia de memória; ambos são supervisionados para descrever apenas conteúdo sustentado pelo vídeo observado até aquele ponto.

Na inferência, o OneStreamer constrói a PHCM incrementalmente, anexando cada registro gerado ao histórico de texto em ordem de geração. Esse histórico passa a funcionar como contexto factual de longo alcance, sem recuperar nem revisitar features visuais históricas.

A janela visual recente permanece intocada.

O PSTL ataca o desequilíbrio de supervisão. Os autores agrupam tokens de estado pela transição entre estados de controle consecutivos e definem uma cota de supervisão por sequência, dada pelo tamanho do maior grupo que aponta para um âncora de saída.

Grupos dentro da cota mantêm supervisão integral; grupos maiores são subamostrados uniformemente sem reposição até a cota. As posições não selecionadas permanecem na sequência causal, mas são excluídas apenas da perda de estado.

A supervisão de todo o texto de tarefa e das legendas continua integral. Na inferência, não há aplicação de PSTL nem política externa de transição: o modelo gera estados e texto diretamente de suas distribuições condicionais aprendidas.

Resultados reportados

Os autores afirmam que o modelo OneStreamer de 4B obtém os melhores resultados entre os métodos comparados nos oito benchmarks de entendimento de vídeo em streaming e resposta proativa avaliados. As ablações controladas trazem três achados que os autores destacam.

Primeiro, retê as legendas geradas proativamente melhora o QA histórico depois que os quadros-fonte saem da janela visual recente. Segundo, combinar contexto visual recente com memória distante de legendas oferece um equilíbrio percepção-memória melhor do que reter o histórico visual completo ou apenas quadros recentes.

Terceiro, o PSTL supera tanto a supervisão densa de tokens de estado quanto um baseline aleatório com supervisão equivalente, supervisionando somente 27,5% dos tokens de estado anotados. Para os autores, esse conjunto de evidências sustenta a geração proativa como mecanismo compartilhado entre percepção, memória e resposta.

Limitações e o que não foi provado

O extrato disponível não inclui uma seção formal de limitações, e é preciso marcar o que os dados apresentados não estabelecem. Os resultados são reportados para um único tamanho de modelo, 4B.

Os autores não demonstram como o comportamento escala para modelos maiores ou muito menores, nem se os ganhos do PSTL se mantêm em outras escalas.

A qualidade da memória de longo prazo depende inteiramente da fidelidade das legendas geradas. Se um registro textual erra ou omite um detalhe relevante, essa informação se perde quando os quadros saem da janela visual, e o paper não quantifica esse modo de falha.

O alinhamento entre conteúdo, granularidade e momento de liberação das saídas vem de um pipeline de síntese construído pelos próprios autores. O quanto o desempenho depende desse pipeline e de suas escolhas de verificação não é isolado nas ablações relatadas.

Também não há, no material disponível, números de latência, custo computacional ou sobrecarga de geração de legendas em tempo real, justamente o gargalo prático de sistemas de streaming. A avaliação se limita aos oito benchmarks escolhidos pelos autores e ao conjunto de métodos com que compararam.

Domínios citados como motivação, como agentes vestíveis e monitoramento de segurança, não são avaliados diretamente, e o paper não testa se o modelo transfere para tarefas ou distribuições de vídeo fora desses benchmarks.

Por que isso importa para quem constrói com IA

A ideia mais transferível do OneStreamer não é um token de controle específico, mas a escolha de representar memória como texto gerado em vez de tokens visuais retidos. Isso muda a economia do contexto: registros compactos e ancorados no tempo ocupam menos espaço do que features visuais históricas, e podem ser inspecionados, auditados e corrigidos por quem opera o sistema, algo difícil com memória latente.

Para quem monta agentes com entrada contínua, o paper também sugere que timing de resposta e conteúdo podem ser aprendidos no mesmo processo generativo, em vez de depender de um classificador de prontidão separado. Vale observar, porém, que a supervisão seletiva de estados só funciona porque existe anotação de estado no treino.

A construção desse tipo de dado segue sendo o gargalo, e o pipeline de síntese proposto é, ele mesmo, parte do resultado, não um detalhe de engenharia.

Em resumo, trata-se de uma contribuição relevante para a fronteira entre percepção contínua e memória em LLMs multimodais, com números expressivos em oito benchmarks, mas cujas garantias fora do protocolo avaliado ainda precisam ser demonstradas.

Referências

  • Zeng, X.; Yang, Y.; Zhang, Z.; Zhu, Y.; Li, X.; Si, Q.; Yao, D.; Ma, C.; Chen, H.; Chen, X.; Shi, Y.; Zhou, J.; Li, Y.; Zhang, J.; Qin, C.; Yang, C.; Yu, X.; Ouyang, K.; Shao, Y.; Wei, Q.; Zhou, C.; Gao, J.; Wang, J.; Wang, L. OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction. arXiv:2610.01762, cs.CV, 2026. Disponível em: https://arxiv.org/abs/2610.01762
  • Página do projeto OneStreamer: https://mcg-nju.github.io/OneStreamer

Últimos Artigos

OneStreamer: memória e resposta proativa em vídeo contínuo
ReaLVR: ancorando o raciocínio latente em evidência visual
RIDE: extrapolar a direção induzida por RL na destilação on-policy
Raven: o "harness de harnesses" para agentes de IA composáveis