On-policy ou off-policy? O que decide o resultado na destilação de LLMs

shape
shape
shape
shape
shape

On-policy ou off-policy? O que decide o resultado na destilação de LLMs

On-policy ou off-policy? O que decide o resultado na destilação de LLMs

Um estudo de Julianna Piskorz, Antonin Berthon e Mihaela van der Schaar testa uma premissa repetida no pós-treinamento de modelos de linguagem. A ideia é que aprender com dados gerados pelo próprio modelo (on-policy) seria melhor do que treinar sobre traços fixos de um professor (off-policy).

Os autores usam um arcabouço controlado de destilação forte-para-fraco. Trabalham com as famílias Llama 3 e Qwen2.5 e tarefas de raciocínio científico, médico e aritmético.

Não encontram vantagem consistente dos rollouts on-policy em acurácia final, esquecimento catastrófico ou esparsidade das atualizações de parâmetros. O que parece governar os resultados é a direção da divergência KL e a taxa de aprendizado.

O que os autores propõem

A proposta central é metodológica. Tratar política de rollout, direção da KL em nível de token e taxa de aprendizado como três eixos independentes, em vez de variá-los em bloco.

No material disponível, os autores listam três contribuições. A primeira é um estudo controlado de destilação que separa esses fatores.

Ele conclui não haver vantagem consistente dos rollouts on-policy em acurácia, esquecimento ou esparsidade.

A segunda é uma explicação dependente do objetivo para a sensibilidade à política de rollout. Vem de análise de gradientes da KL e de experimentos ao longo de um espectro contínuo de políticas entre aluno e professor.

A terceira caracteriza quando dados on-policy ajudam de fato. Eles beneficiariam a generalização para variantes mais difíceis de uma tarefa e poderiam reduzir a transferência incidental de estilo do professor.

Contexto: qual problema está sendo atacado

A literatura de pós-treinamento atribui ao aprendizado on-policy uma série de vantagens. Menor esquecimento catastrófico, segundo trabalhos de Shenfeld e colegas em 2025 e 2026 e de Chen e colegas em 2025.

Atualizações de parâmetros mais esparsas, segundo Mukherjee e colegas, 2025. Melhor generalização além da distribuição de treino, segundo Chu e colegas, Yuan e colegas, Zhang e colegas e Ming e colegas.

O problema, argumentam os autores, é a origem dessas conclusões. Elas vêm majoritariamente de comparações entre supervised fine-tuning (SFT) e reinforcement learning com recompensas verificáveis (RLVR).

Nesse tipo de comparação, mudam ao mesmo tempo o objetivo de otimização, a fonte e a densidade da supervisão, o sinal de recompensa, a escala de otimização, o uso de gradient clipping e a taxa de aprendizado. Efeitos atribuídos à política de rollout podem decorrer desses outros fatores.

A questão tem consequência prática direta. Métodos on-policy exigem geração contínua durante o treinamento.

Métodos off-policy podem reutilizar dados já existentes. Se os benefícios propostos vierem de outras escolhas de projeto, esse custo adicional seria frequentemente desnecessário.

Para isolar a variável, os autores usam destilação forte-para-fraco. Nela é possível trocar a política que gera os dados mantendo o resto do pipeline fixo.

Como funciona

No arcabouço formal, uma política de rollout gera as sequências de saída. O objetivo de destilação calcula a média da discrepância token a token entre as distribuições do aluno e do professor ao longo dos prefixos visitados por essa política.

Quando a política de rollout é o professor, tem-se destilação off-policy (OffPD, na linha de Sanh e colegas, 2020). Quando é o aluno, tem-se destilação on-policy (OnPD, na linha de Agarwal e colegas, 2023).

Variantes híbridas já interpolavam as duas, por exemplo misturando tokens gerados por aluno e professor (Xu e colegas, 2024).

Um ponto técnico importante: os autores calculam a KL sobre o vocabulário completo, e não a partir de tokens amostrados. Isso elimina a variância adicional dos estimadores por amostragem.

Os gradientes são interrompidos através do processo de amostragem, tratando as trajetórias como fixas em cada atualização. Com isso, o pareamento convencional entre off-policy e KL direta (forward) e entre on-policy e KL reversa deixa de ser uma imposição.

Segundo os autores, esse acoplamento só se sustenta no nível do valor do objetivo, via decomposições pela regra da cadeia, ou quando a KL é estimada com uma única amostra. Com KL sobre todo o vocabulário, direção e política de rollout podem ser cruzadas livremente.

É o que o experimento faz.

O desenho experimental varia independentemente política de rollout, direção da KL e taxa de aprendizado (duas configurações), mantendo o resto fixo. Cada aluno passa por fine-tuning de todos os parâmetros por 150 passos de otimização, com três sementes aleatórias por configuração.

Além da comparação binária, os autores percorrem um espectro contínuo de políticas de rollout entre aluno e professor. Extrapolam além de ambos os extremos, para favorecer tokens preferidos por um modelo em detrimento do outro.

Analisam os gradientes da KL para explicar o padrão observado.

Resultados reportados

O retrato que emerge é mais nuançado do que a hipótese on-policy sugere. Os autores relatam não haver vantagem consistente da destilação on-policy em acurácia na distribuição de treino, esquecimento catastrófico ou esparsidade das atualizações.

A direção da KL molda de forma mais clara o desempenho na tarefa, a estabilidade do treinamento e a cobertura de saídas. A KL direta produz ganhos maiores de pass@ na tarefa dentro da distribuição do que a KL reversa.

A taxa de aprendizado governa o grau de esquecimento e a esparsidade das atualizações, com pouca ou nenhuma variação atribuível à política de rollout. Não há evidência, segundo os autores, de que rollouts on-policy preservem capacidades anteriores ou induzam atualizações mais esparsas.

A assimetria entre objetivos aparece com força no espectro contínuo de políticas. A KL direta é robusta a mudanças na política de rollout, mantendo desempenho estável e forte.

A KL reversa é substancialmente mais sensível e favorece rollouts gerados pelo aluno.

Onde os dados on-policy parecem ajudar de forma consistente é na generalização para variantes mais difíceis da tarefa aritmética Countdown, sob ambas as direções de KL. Esse benefício inicial não persistiu de forma confiável após RLVR subsequente.

Os autores também observam que, combinados com KL reversa, rollouts on-policy reduzem a transferência incidental de estilo do professor. As conclusões principais se mantêm em testes de robustez: removendo gradient clipping, substituindo a KL de vocabulário completo por estimadores amostrados comuns e treinando em tarefas que exigem cadeias de raciocínio mais longas.

Limitações e o que não foi provado

O estudo é uma demonstração dentro de um regime específico: destilação forte-para-fraco, 150 passos de otimização, três sementes, duas taxas de aprendizado e as famílias Llama 3 e Qwen2.5.

Nada nele prova que aprendizado on-policy seja inútil em outros regimes. Nem que as conclusões de comparações entre SFT e RLVR se transfiram automaticamente para destilação.

O argumento dos autores é justamente que aquelas comparações não isolam a variável.

O próprio resultado mais favorável ao on-policy, a generalização para variantes difíceis de Countdown, é frágil. Não sobrevive de forma confiável a um estágio posterior de RLVR.

Há também uma ressalva de interpretação que os autores explicitam. Como os gradientes são interrompidos através da amostragem, a atualização de KL reversa on-policy não é, em geral, o gradiente total da KL reversa em nível de sequência.

O pareamento tradicional vale apenas no nível do valor do objetivo.

O cálculo da KL sobre o vocabulário completo pressupõe acesso às distribuições do professor a cada prefixo. É uma vantagem logística que nem todo pipeline de destilação tem.

Os autores verificaram que estimadores amostrados não alteram as conclusões centrais.

Por que isso importa para quem constrói com IA

Para quem monta pipelines de pós-treinamento, a mensagem é de alocação de recursos. Gerar rollouts continuamente é caro.

Se a KL direta é robusta à política de rollout, como relatam os autores, boa parte desse custo pode ser evitada reutilizando dados do professor sem perda relevante nos eixos medidos.

Se o objetivo é KL reversa, o cenário se inverte e rollouts do aluno passam a importar de verdade. E a taxa de aprendizado, não a política de dados, é o botão principal para controlar esquecimento e esparsidade.

Isso sugere calibrar esse hiperparâmetro antes de investir em infraestrutura de geração.

Isso não significa descartar métodos on-policy. Significa que, ao justificar seu custo, convém verificar se o ganho observado vem da política de rollout ou de escolhas vizinhas de objetivo e otimização que viajaram junto com ela.

Referências

PISKORZ, Julianna; BERTHON, Antonin; VAN DER SCHAAR, Mihaela. On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics. arXiv:2609.35259 [cs.LG], 28 set.

  1. Disponível em: https://arxiv.org/abs/2609.35259

Trabalhos citados pelos autores no material de origem: Hinton et al. (2015); Sanh et al.

(2020); Agarwal et al. (2023); Xu et al.

(2024); Mukherjee et al. (2025); Shenfeld et al.

(2025, 2026); Chen et al. (2025); Chu et al.

(2025); Ming et al. (2025); Yuan et al.

(2026); Zhang et al. (2026b).

Últimos Artigos

On-policy ou off-policy? O que decide o resultado na destilação de LLMs
OneStreamer: memória e resposta proativa em vídeo contínuo
ReaLVR: ancorando o raciocínio latente em evidência visual
RIDE: extrapolar a direção induzida por RL na destilação on-policy