Destilação entre tokenizadores distintos: cobertura não é confiabilidade

shape
shape
shape
shape
shape

Destilação entre tokenizadores distintos: cobertura não é confiabilidade

Destilação entre tokenizadores distintos: cobertura não é confiabilidade

Bingxi Hou, Guochao Jiang, Guofeng Quan, Weiqing Li, Wenfeng Feng, Guohua Liu e Yuewei Zhang investigam uma suposição difundida na destilação on-policy (OPD) entre modelos com tokenizadores diferentes. A ideia é que ampliar a cobertura de alinhamento entre professor e aluno deveria melhorar o aprendizado.

O paper mostra que a resposta é negativa em seus experimentos.

Em três pares heterogêneos de modelos, o alinhamento estrito já cobre de 85,57% a 96,98% dos tokens gerados pelo aluno. A sobreposição estática de vocabulário (Jaccard) é de apenas 39,49% a 64,87%.

Quando os autores acrescentam supervisão sobre os trechos sem alinhamento estrito, a cobertura estrutural chega a 100%. A acurácia cai em todas as 18 configurações testadas.

O ganho, segundo eles, está do outro lado. Restringir a KL reversa a um subconjunto top-16 do vocabulário compartilhado, escolhido pelo próprio aluno, preserva ao menos 96% da melhoria obtida com o vocabulário compartilhado completo.

O que os autores propõem

A contribuição central é uma mudança de critério, não um novo método de ponta. Os autores argumentam que a comunidade deveria deslocar o foco de "cobertura de alinhamento" para "confiabilidade da supervisão".

Cobertura mede quanto da resposta e do vocabulário pode ser comparado entre tokenizadores. Confiabilidade mede se o alvo fornecido pelo professor realmente orienta o aluno nos estados que ele visita.

Na prática, eles mantêm o objetivo estrito. A KL reversa é aplicada apenas em posições estritamente alinhadas, com as distribuições restritas e renormalizadas sobre o vocabulário compartilhado.

Essa supervisão compacta é suficiente, dizem.

O subconjunto top-16 por posição estrita é selecionado a partir das probabilidades do aluno, e não do professor. Isso reduz o custo computacional da KL sem degradar a acurácia de forma relevante nos testes realizados.

A tese é que sinais adicionais só valem a pena se sobreviverem ao teste da interação com o objetivo estrito e do desempenho downstream.

Contexto: qual problema está sendo atacado

A destilação on-policy treina o aluno sobre suas próprias gerações, usando feedback do professor. Pode ser vista como um caso especial de aprendizado por reforço denso com restrição KL de peso relativo fixo.

Quando professor e aluno vêm de famílias diferentes, a mesma resposta tem fronteiras de token distintas. As distribuições de próximo token vivem em vocabulários distintos.

Isso obriga o método a resolver alinhamento em dois níveis: sequência e vocabulário.

Trabalhos recentes atacaram esse obstáculo por caminhos variados, citados pelos autores. Correspondência de distribuições baseada em rank, mapeamentos aprendidos, correspondência de verossimilhança e interfaces em nível de byte (Boizard et al., 2025; Zhang et al., 2024; Minixhofer et al., 2025; Singh et al., 2026).

Para treino on-policy, o SimCT recupera supervisão via unidades multi-token alinhadas e relata ganhos sobre OPD de vocabulário compartilhado (Sun et al., 2026). Já o Byte-Prefix Marginalization projeta massa de probabilidade do professor sobre tokens do aluno.

Também identifica supervisão nociva em posições de espaço em branco (Wang et al., 2026).

Diante desse ecossistema, a pergunta dos autores é direta: quanto de supervisão útil o matching estrito já retém, e o que a recuperação dos alvos excluídos efetivamente acrescenta ao aprendizado? A hipótese que eles testam é que a contagem estática de sobreposição de vocabulário é enganosa.

Entradas de vocabulário têm frequência e probabilidade preditiva muito desiguais em trajetórias reais do aluno.

Como funciona

O alinhamento é construído por grupos de tokens. A resposta decodificada é tokenizada pelos dois tokenizadores.

Os offsets compartilhados por ambas as sequências são preservados, incluindo início e fim da resposta. Cada intervalo entre fronteiras consecutivas gera um par de grupos alinhados.

Grupos estritos têm exatamente um token do aluno e um do professor cobrindo o mesmo intervalo. Grupos de mismatch exigem múltiplos tokens de pelo menos um dos lados.

O vocabulário compartilhado é definido pela identificação de entradas pelo token subjacente, excluindo tokens especiais e correspondências ambíguas. As distribuições são então restritas e renormalizadas sobre esse vocabulário.

A KL reversa é somada apenas nas posições estritas.

Para testar o valor dos grupos de mismatch, os autores adicionam uma perda de erro quadrático médio (MSE) sobre log-probabilidades de span. As log-probabilidades são calculadas a partir das probabilidades dos caminhos de tokens observados em cada grupo.

A perda total é a soma do objetivo estrito com um termo de span ponderado por λ. Todo λ positivo supervisiona todos os grupos de mismatch.

Qualquer peso maior que zero produz cobertura estrutural de 100%. É exatamente esse o ponto que os autores querem tensionar.

O setup cobre três pares professor→aluno: Qwen2.5-7B-Instruct → Llama-3.2-3B-Instruct, Granite-4.1-8B → Phi-4-mini-instruct e Granite-4.1-8B → Qwen2.5-7B-Base. O treino parte de um pool de 20.000 prompts: 10.000 de matemática do DAPO-Math-17K e 10.000 de código do CodeForces. A avaliação matemática usa MATH500, GSM8K, AIME-2024, AIME-2025, AIME-2026, AMC23 e Minerva-Math (mean@32).

A de código usa HumanEval, MBPP e LiveCodeBench (mean@8). A métrica "full average" dá peso igual às médias aritméticas dos dois domínios.

Cada execução salva 512 rollouts em cada uma de 100 iterações, totalizando 51.200 respostas.

Resultados reportados

O primeiro achado é que cobertura estrita é alta e estável. Ao longo das execuções completas, 85,57% a 96,98% dos tokens do aluno e 82,82% a 97,26% dos tokens do professor pertencem a grupos estritos.

A variação entre três janelas disjuntas de treino (passos 1–20, 41–60 e 81–100) é de no máximo 1,43 ponto percentual para tokens do aluno e 3,75 para tokens do professor. O par Granite → Phi tem a menor sobreposição Jaccard, mas a maior cobertura sob ambas as tokenizações.

É evidência direta de que a métrica estática de vocabulário não prediz o aproveitamento.

O segundo achado é o resultado negativo. Com λ = 0, cada par atinge sua melhor full average.

Todas as 18 configurações com peso positivo ficam de 0,27 a 1,20 ponto percentual abaixo das respectivas baselines estritas. A tendência geral é de queda conforme λ cresce.

Os autores também relatam que λ = 0 dá a melhor média em matemática e em código para cada par.

O terceiro achado é sobre concentração de massa. Em respostas amostradas dos alunos antes da destilação, o vocabulário compartilhado retém quase toda a massa de probabilidade de ambos os modelos nas posições estritas.

O subconjunto top-16 selecionado pelo aluno também retém a maior parte dessa massa. Com essa restrição, o treino preserva pelo menos 96% da melhoria obtida pelo OPD com vocabulário compartilhado completo.

Tanto o objetivo estrito completo quanto o compacto superam as baselines cross-tokenizer avaliadas nos três pares.

O quarto achado é o diagnóstico de gradientes. Em checkpoints treinados apenas com a perda estrita, os gradientes de span mostram concordância direcional fraca ou negativa com os gradientes estritos.

Essa concordância fica consistentemente abaixo de uma referência construída dividindo as posições que contribuem para a perda estrita em dois subconjuntos. A razão entre a norma do gradiente de span e a do gradiente estrito cresce ao longo dos checkpoints medidos.

Os autores sugerem que essa escala relativa crescente de sinais fracamente alinhados pode ajudar a explicar a queda de acurácia ao adicionar supervisão de span.

Limitações e o que não foi provado

O estudo cobre três pares professor–aluno e dois domínios, matemática e código, com alunos tanto instruction-tuned quanto base. Isso é um recorte, não uma lei geral.

Os próprios autores não reivindicam generalidade além dele. Trabalhos futuros precisariam testar outros pares, outras famílias de tokenizadores e outros domínios.

O diagnóstico de gradiente é apresentado de forma cautelosa. Os autores escrevem que ele "pode ajudar a explicar" a queda, não que a estabelece causalmente.

Correlação entre concordância direcional fraca e piora de acurácia não é prova de mecanismo.

O resultado negativo também é específico à formulação testada: MSE sobre log-probabilidades de span. Nada foi provado sobre outras perdas, outros agrupamentos multi-token ou outras formas de incorporar os grupos de mismatch.

As comparações com baselines cross-tokenizer são as avaliadas pelos próprios autores neste setup. Não há indício de um benchmark público padronizado para esse tipo de comparação, e o material não informa venue nem página de projeto.

A conclusão não é que cobertura seja irrelevante. É que ampliar cobertura com sinais fracamente alinhados ou conflitantes pode custar mais do que entrega.

É uma afirmação condicional, não absoluta.

Por que isso importa para quem constrói com IA

Para quem faz pós-treino na prática, o recado é econômico. Destilar de um professor de outra família, tipicamente maior e mais forte, costuma parecer exigir um pipeline elaborado de remapeamento de vocabulário, com dicionários aprendidos, marginalização de bytes ou agrupamentos multi-token.

O paper sugere que, em vários cenários, basta aplicar KL reversa nas posições estritamente alinhadas, com as distribuições renormalizadas sobre o vocabulário compartilhado, e restringir ainda mais o suporte a um top-16 escolhido pelo aluno. Menos engenharia, menos custo por passo e acurácia comparável ou superior.

A segunda lição é sobre medição. Relatar sobreposição de vocabulário como proxy de compatibilidade entre modelos é frágil.

O par com menor Jaccard no estudo foi justamente o de maior cobertura estrita. Quem monitora pipelines de destilação deveria acompanhar cobertura em trajetórias do aluno e concentração de massa de probabilidade, não apenas estatísticas de vocabulário.

A terceira é metodológica. Antes de escalar um sinal auxiliar, seja supervisão de span, seja qualquer perda adicional sobre trechos não alinhados, vale checar sua interação com o objetivo principal, inclusive com diagnósticos de gradiente.

Um sinal que cresce em magnitude relativa enquanto aponta para direções discordantes é candidato a sabotar silenciosamente o treino. A cobertura aumenta, os relatórios parecem melhores, e a acurácia cai.

Esse tipo de verificação é barato comparado ao custo de uma rodada completa de destilação mal calibrada.

Referências

  • HOU, Bingxi; JIANG, Guochao; QUAN, Guofeng; LI, Weiqing; FENG, Wenfeng; LIU, Guohua; ZHANG, Yuewei. Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability. arXiv:2610.08448, 2026. Disponível em: https://arxiv.org/abs/2610.08448
  • DAPO-Math-17K (Yu et al., 2025), pool de prompts de matemática utilizado no treino.
  • CodeForces (open-r1), pool de prompts de código utilizado no treino. Disponível em: https://huggingface.co/datasets/open-r1/codeforces
  • IBM Granite 4.1, família de modelos usada como professora no estudo. Disponível em: https://huggingface.co/blog/ibm-granite/granite-4-1
  • Benchmarks citados pelos autores: MATH500, GSM8K, AIME-2024, AIME-2025, AIME-2026, AMC23, Minerva-Math, HumanEval, MBPP e LiveCodeBench.

Últimos Artigos

Destilação entre tokenizadores distintos: cobertura não é confiabilidade
RealCompanion: benchmark com conversas reais expõe limites da memória de IA
Dobramento de proteínas melhora raciocínio geral em LLMs, dizem autores
On-policy ou off-policy? O que decide o resultado na destilação de LLMs