A destilação on-policy costuma tratar o professor como ponto de chegada. Neste paper, Hao Li, MeiJia Chen, Weijie Ren, Donghan Li, Zijun Tian, Jingchun Huang e Naibo Wang argumentam que um professor treinado por aprendizado por reforço (RL) define também uma direção.
Essa direção é o deslocamento entre seus estados internos e os do checkpoint pré-RL.
Os autores propõem o RIDE (RL-Induced Direction Extrapolation). O método extrapola esse resíduo no espaço de representações, camada por camada, em vez de fazê-lo sobre logits.
Segundo eles, o método se aproxima ou supera o próprio professor RL nos quatro pares base/professor testados: R1-Distill-1.5B, Qwen3-4B, Llama-3.2-3B e Phi-4-mini. A medição usa Avg@16 em AIME24, AIME25 e AIMO.
O paper está disponível no arXiv com 19 páginas.
O que os autores propõem
A proposta central é trocar o alvo de aprendizado. Em vez de o estudante regredir exatamente para o professor, ele é levado a um ponto além do professor na direção do resíduo induzido por RL.
Os autores definem um cenário de mesma inicialização. Existe um checkpoint base, um professor obtido por RL a partir desse base e um estudante inicializado nesse mesmo base.
Os três compartilham arquitetura, tokenizer e origem representacional. A diferença entre o estado oculto do professor e o do checkpoint pré-RL, na mesma camada e na mesma posição de token, isola o que o RL mudou naquele contexto.
O alvo do RIDE é esse estado do professor deslocado além dele por um único coeficiente. Com coeficiente igual a zero, o método recupera exatamente a destilação por representações on-policy (OPRD).
Com valores intermediários, o alvo fica entre base e professor. Com valores acima de um, fica além do professor.
Os autores apresentam três contribuições. A primeira é identificar o resíduo de representação induzido por RL como medida da mudança computacional.
A segunda é propor o RIDE como extrapolação desse resíduo. A terceira é interpretar o objetivo como maximização de uma recompensa linear direcional sob penalidade quadrática centrada no professor.
É uma versão em espaço de representação da extrapolação de recompensa feita em espaço de saída.
Contexto: qual problema está sendo atacado
A destilação on-policy (OPD) faz o estudante amostrar suas próprias trajetórias. Ele recebe supervisão por token do professor nos prefixos que realmente visita.
Isso reduz viés de exposição e fornece sinal denso. Uma variante comum é transferir os ganhos de um professor RL de volta para o modelo base.
Trabalhos recentes mostram que a razão de log-probabilidade entre professor e referência funciona como recompensa implícita. Ao aumentar o peso dessa recompensa em relação à restrição KL, é possível obter estudantes que superam o professor.
O problema, segundo os autores, é que essa extrapolação é medida depois que o head do modelo já atenuou a maior parte da mudança. O head é linear e reweighta as mudanças de representação de acordo com seu espectro singular anisotrópico.
As direções que ele menos amplifica carregam boa parte da energia do resíduo professor-base no espaço oculto. Nos logits centrados, porém, resta apenas uma fração pequena dessa energia.
Ou seja, objetivos em espaço de saída supervisionam fracamente justamente as direções onde o resíduo se concentra. E não impõem restrição alguma às camadas anteriores.
Some-se a isso que a razão de log-probabilidade do token amostrado tem viés de comprimento. É propensa a overoptimization.
Quando escalada por um coeficiente global, amplifica recompensas extremas e desestabiliza o treino. É esse conjunto de patologias que motiva medir a direção antes do head.
Como funciona
Em cada rollout do estudante, os dois modelos congelados são avaliados sobre os mesmos tokens. São o professor RL e o checkpoint pré-RL.
A diferença camada a camada é o resíduo, calculado deterministicamente a partir de dois forward passes, sem ruído de amostragem.
O alvo é o estado do professor somado ao resíduo multiplicado por um coeficiente. A perda é o erro quadrático normalizado por dimensão, aplicado a todas as camadas e às posições finais da resposta, onde a discordância estudante-professor se concentra.
Como apenas o alvo muda em relação à regressão de representações, qualquer diferença de comportamento entre RIDE e OPRD é atribuível ao termo residual.
Os autores justificam a escolha do espaço oculto com dois argumentos. Primeiro, como o head é linear, o alvo de espaço de saída é a imagem do alvo do RIDE projetada pelo head.
A recíproca não vale: um alvo em logit restringe pouco as direções que o head menos amplifica e não restringe as camadas anteriores. Segundo, o gradiente condicionado a um rollout é determinístico, ao contrário do gradiente da perda por token amostrado, o que evita amplificar ruído.
O código e a página do projeto estão em GitHub.com/xixixixixxxx/RIDE.
Resultados reportados
Os autores avaliam quatro pares base/professor que cobrem escalas, famílias de modelos, vocabulários e linhagens de pré-treinamento diferentes: R1-Distill-1.5B, Qwen3-4B, Llama-3.2-3B e Phi-4-mini. A métrica principal é Avg@16 em três benchmarks de matemática competitiva: AIME24, AIME25 e AIMO.
Segundo o paper, o RIDE obtém média de Avg@16 superior à do OPRD e às baselines de extrapolação em espaço de saída nos quatro pares. O método se aproxima ou excede o próprio professor treinado por RL.
Os autores afirmam que o RIDE é o único método cuja média supera o professor em todos os pares.
A extrapolação em espaço de saída fica abaixo do professor em todos os pares. Ela degrada o estudante sempre que o professor está próximo do base.
É exatamente o cenário em que o resíduo é pequeno e a extrapolação sobre logits amplifica mais ruído do que sinal. O paper complementa os resultados com análises de atenuação pelo head e de variância condicional, usadas para caracterizar o sinal de aprendizado do método.
Limitações e o que não foi provado
A primeira restrição é estrutural: o método depende de ter em mãos o checkpoint pré-RL. O RIDE só é aplicável no cenário de mesma inicialização, em que base, professor e estudante compartilham origem representacional.
Quando o professor vem de outra linhagem, não existe resíduo a medir.
A segunda é a premissa de que a mudança induzida por RL é pequena, estruturada e consistente entre execuções. E de que direções comportamentais no espaço oculto têm estrutura aproximadamente linear.
Se uma execução de RL produzir deslocamentos ruidosos ou heterogêneos, a extrapolação pode amplificar variação em vez de capacidade.
Terceiro, a perda não é normalizada e sua escala cresce com o coeficiente de extrapolação. Os autores optam por reescalar o coeficiente da perda em vez de normalizar o alvo, para que o caso limite reduza exatamente ao OPRD.
Isso deixa em aberto como calibrar o coeficiente em outros domínios.
Quarto, a evidência empírica se limita a quatro pares de modelos e a três benchmarks de matemática. Nada no material garante que o ganho se transfira para outros domínios, para tarefas agênticas ou para modalidades além de texto.
Os resultados são reportados como média e como "aproxima ou excede", não como vitória em toda configuração. Os autores também não oferecem, no trecho disponível, uma caracterização teórica de até onde é seguro extrapolar.
Nada garante que o estudante permaneça em uma região válida do espaço de representações.
Por que isso importa para quem constrói com IA
Para equipes que treinam modelos, o RIDE aponta um caminho concreto para reaproveitar execuções caras de RL. Em vez de repetir o treino, destila-se o resultado de volta ao modelo base aproveitando o checkpoint salvo antes do RL.
É também relevante para merge de especialistas que compartilham um mesmo base, caso em que os três modelos já existem por construção.
O argumento técnico mais transferível é o de que a supervisão por representações carrega informação que a supervisão por logits não vê. E que o gradiente determinístico por rollout é mais estável que o gradiente por token amostrado.
Isso dialoga diretamente com a literatura de controle e direções no espaço oculto, que já usa vetores de ativação para steering.
O custo é operacional. Cada rollout exige forward passes extras do professor congelado e do checkpoint base, além do próprio estudante.
A organização precisa manter o checkpoint pré-RL versionado. Para times com compute limitado, a decisão prática é menos sobre o coeficiente de extrapolação e mais sobre disciplina de checkpointing e avaliação.
Sem elas, o método simplesmente não é aplicável.
Referências
- Hao Li, MeiJia Chen, Weijie Ren, Donghan Li, Zijun Tian, Jingchun Huang, Naibo Wang. The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation. arXiv:2609.36484. arXiv.org/abs/2609.36484
- Página do projeto e código: GitHub.com/xixixixixxxx/RIDE
- Trabalhos citados pelos autores como base do método: Hinton et al. (2015) sobre destilação; Romero et al. (2015) sobre destilação em nível de features; Rafailov et al. (2023) sobre recompensa implícita por razão de log-probabilidade; Yang et al. (2026a) sobre OPRD; Yang et al. (2026b) sobre extrapolação de recompensa em espaço de saída.




