Um autoencoder de representação (RAE) escolhe, antes de qualquer treinamento generativo, quais camadas de um encoder visual congelado vão compor o espaço latente. Esse espaço é o que o modelo de difusão precisa aprender a modelar.
A proposta de Hongyang Du e colegas se chama FuseReg. Ela ataca exatamente essa escolha.
Em vez de fixar um subconjunto de camadas, os autores treinam o decoder e o transformer de difusão sobre médias normalizadas de subconjuntos sorteados a cada exemplo.
A tese central é que essa randomização funciona como regularizador. Ela reduz a dependência de atalhos em camadas rasas e ameniza o que o artigo chama de "gap entre reconstrução e geração".
Esse gap é o descompasso entre a fusão de camadas que reconstrói melhor e a que gera melhor.
O que os autores propõem
FuseReg (de layer-fusion regularization) é apresentado como um regularizador do ponto de interface entre o gerador e o decoder. O gerador modela a distribuição latente; o decoder transforma latentes gerados em pixels.
No treinamento, o método sorteia máscaras de Bernoulli por exemplo. A máscara é condicionada a ser não vazia, e os pesos são normalizados pela cardinalidade do subconjunto sorteado.
A esperança da fusão amostrada é idêntica à da fusão com todas as camadas. Isso mantém o latente de implantação estável em média e transforma a variação em sinal de regularização.
Os autores aplicam o mesmo princípio em dois estágios, com taxas de descarte separadas: p_dec para o decoder e p_dit para o DiT. Os dois resolvem problemas de predição diferentes.
O resultado prático alegado é um único decoder capaz de operar com fusões completas, esparsas e de camada única sem retreinamento por configuração.
As contribuições formais listadas incluem o próprio regularizador de fusão de camadas. Incluem também uma base teórica que mostra que a amostragem preserva a média da fusão completa e converte a discordância entre camadas em penalidade explícita.
Há ainda um resultado de separação de segunda ordem em relação a qualquer fusão global determinística, incluindo seleção heurística de camadas e portões globais aprendíveis.
Contexto: qual problema está sendo atacado
RAEs usam um encoder visual congelado para definir o espaço latente de um modelo de difusão. Aprendem um decoder que mapeia as features do encoder de volta para pixels (Zheng et al., 2025).
Um encoder visual produz uma hierarquia cujo conteúdo muda com a profundidade. Alguém precisa decidir como essas camadas se tornam um único latente.
O RAEv2 aposta em uma heurística fixa: somar as últimas camadas do encoder (Singh et al., 2026).
Segundo os autores, essa decisão serve a dois senhores. No cenário com DINOv3-L (Siméoni et al., 2025), ampliar o subconjunto fundido melhora o PSNR de reconstrução, mas piora o gFID não guiado e o gFID guiado.
Camadas rasas, alinhadas ao pixel, ajudam diretamente as perdas de reconstrução como L2 e LPIPS (Zhang et al., 2018). Camadas profundas, mais semânticas, favorecem o modelo de difusão.
A fusão que preserva melhor a qualidade de pixel não é a mais fácil de modelar generativamente. Esse é o gap que o artigo endereça.
Os autores também relatam que um portão global aprendível se concentra em um atalho de camada única, o que reforça a fragilidade de qualquer escolha fixa.
Trabalhos vizinhos atacam o mesmo território por outro ângulo. DRoRAE e métodos de sondagem atenta em múltiplas camadas aprendem pesos determinísticos entre profundidades (Zhu et al., 2026; Ciernik et al., 2026).
A diferença de enquadramento é explícita: em vez de buscar a fusão ótima, FuseReg pergunta como decoder e gerador podem continuar eficazes ao longo de uma família de fusões. A linhagem metodológica passa por dropout (Srivastava et al., 2014), nested dropout (Rippel et al., 2014), LayerDrop (Fan et al., 2020) e Matryoshka representation learning (Kusupati et al., 2022).
Como funciona
Os autores colocam as fusões existentes em uma formulação comum. Dada uma imagem e um encoder congelado, cada camada escolhida gera tokens normalizados por layer norm, com tokens de patch e dimensão de feature.
Uma regra de fusão mapeia esses recursos ao latente único consumido pelo decoder de pixels ou pelo DiT. Os pesos são escolhidos independentemente da entrada.
Fusões fixas de camada única e de prefixo usam um vetor de pesos fixo. Um portão global aprendível otimiza esses pesos, mas os compartilha entre todas as entradas.
FuseReg substitui esse vetor fixo por uma distribuição sobre subconjuntos. Para p ∈ (0,1), sorteia-se uma máscara i.i.d. de Bernoulli e condiciona-se a que ela não seja vazia.
Os pesos de fusão são a máscara normalizada pela cardinalidade do subconjunto.
O suporte cobre todos os subconjuntos não vazios. Na inferência, todas as camadas são mantidas por padrão, o que recupera a média de camada completa.
Subconjuntos são usados apenas para testar robustez.
O mesmo mecanismo é aplicado nos dois estágios. No decoder, a amostragem treina o decodificador de pixels a reconstruir imagens a partir de várias composições de camadas, sob objetivo de pixel, perceptual e adversarial (Zhang et al., 2018; Goodfellow et al., 2014).
No DiT, a amostragem varia a composição de camadas que entra no caminho de fluxo ruidoso, mas mantém um alvo de predição comum: o agregado de todas as camadas.
Com um interpolante de flow matching (Lipman et al., 2023) construído a partir de um agregado de subconjunto, o DiT regride o alvo de camada completa com perda de predição ponderada pelo tempo. Com p = 0, recupera-se o objetivo padrão de fusão completa.
A análise teórica usa um modelo linear com perda quadrática como substituto tratável. Os autores definem a média de todas as camadas, os desvios por camada e sua covariância.
Mostram uma identidade exata para o coeficiente de variância esperada da amostragem. Também comparam regras de fusão pelos dois primeiros momentos dos pesos.
A conclusão é que nenhuma fusão global determinística consegue igualar esses momentos.
A página do projeto (hongyang-du.GitHub.io/FuseReg) e as seções E do artigo trazem as derivações completas.
Resultados reportados
O protocolo separa efeitos de decoder e de gerador em três experimentos. O primeiro avalia um único decoder ao longo de várias fusões.
O segundo troca decoders mantendo o DiT e os latentes amostrados fixos. O terceiro regulariza os dois estágios conjuntamente.
O encoder é o DINOv3-L congelado, e um decoder ViT é treinado do zero em ImageNet-256 (Russakovsky et al., 2015). Todas as variantes de decoder são pareadas em arquitetura, número de parâmetros, hiperparâmetros de otimização e orçamento de passos de treino.
Os varreduras de DiT impõem os mesmos controles nas escalas DiT-Base e DiT-XL.
As métricas de reconstrução são PSNR, SSIM (Wang et al., 2004) e rFID (Heusel et al., 2018), medidas sobre 50 mil imagens. As métricas generativas são gFID e Inception Score (Salimans et al., 2016), medidas sobre 50 mil amostras de um DiT condicional a classe (Peebles e Xie, 2023) com passos de Euler.
A Tabela 1 avalia cada decoder em três fusões: completa, esparsa e de camada única.
Segundo os autores, um único decoder FuseReg reconstrói de forma confiável a partir de fusões completas, esparsas e de camada única. A substituição apenas do decoder reduz o gFID não guiado, e a regularização conjunta reduz o gFID do DiT-Base.
Os autores afirmam que esses ganhos vêm sem custo computacional adicional e sem mudanças arquiteturais. O mecanismo atua apenas sobre como o latente é construído durante o treino.
Limitações e o que não foi provado
Os próprios autores delimitam o alcance da teoria. Os resultados são exatos para preditores lineares homogêneos sob perda quadrática.
Servem para identificar o sinal de treino induzido pela amostragem de subconjuntos, não para substituir os experimentos com modelos não lineares. A comparação com fusões determinísticas também é restrita a regras de fusão independentes da entrada.
O material disponível não detalha ablações das duas taxas de descarte p_dec e p_dit, nem uma receita para escolhê-las. Elas adicionam dois hiperparâmetros ao pipeline.
Também não há, no trecho analisado, evidência de generalização para outros encoders além do DINOv3-L, para outras resoluções além de 256, ou para vídeo. Os autores citam a extensão do paradigma de RAE para geração de vídeo em trabalhos anteriores.
Os valores numéricos absolutos das comparações de PSNR, gFID e Inception Score não constam do extrato consultado. Isso impede verificar a magnitude dos ganhos relatados.
Restam a direção dos efeitos e a afirmação de melhora.
O desenho experimental não isola quanto da robustez vem da normalização pela cardinalidade e quanto vem simplesmente da variação estocástica das máscaras.
Por que isso importa para quem constrói com IA
Para quem monta pipelines sobre encoders visuais congelados, a lição prática é que a interface entre representação e gerador é uma dimensão de projeto, não um detalhe de implementação.
Um decoder que funciona bem com uma fusão específica vira um gargalo quando o time quer experimentar outra composição de camadas, trocar o encoder ou treinar o gerador em um regime diferente.
Um decoder robusto a uma família de fusões reduz o número de checkpoints a manter e evita retreinamentos a cada mudança de configuração. A vantagem é relevante quando o custo de treino é dominado pelo gerador, não pelo decoder.
O artigo também é um lembrete metodológico: reconstrução e geração não otimizam a mesma coisa. Times que ajustam tokenizers e decoders medindo apenas PSNR ou rFID podem estar escolhendo a configuração que reconstrói melhor e gera pior.
Medir gFID junto com as métricas de reconstrução, e tratar a discordância entre camadas como um diagnóstico explícito, é uma prática que este trabalho reforça.
A ideia de treinar um consumidor para ser indiferente a variações no insumo tem precedentes consolidados: nested dropout, LayerDrop, Matryoshka. Aqui ela é reaplicada a um ponto específico do stack generativo, o que sugere que o padrão ainda tem espaço para ser reutilizado em outras interfaces.
Referências
DU, Hongyang; XIE, Yunfei; YE, Junjie; YANG, Jiawei; CONG, Xiaoyan; ZHANG, Haodong; HUANG, Yongchao; WU, Haiyu; LI, Zongxia; GUI, Shihang; LIU, Dawei; LI, Runhao; NI, Jingcheng; WEI, Chen; BALESTRIERO, Randall; WANG, Yue. FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders. arXiv:2609.31620, 2026. Disponível em: arXiv.org/abs/2609.31620.
Página do projeto: hongyang-du.GitHub.io/FuseReg.
Referências citadas no artigo: ZHENG et al. (2025); SINGH et al.
(RAEv2, 2026); SIMÉONI et al. (DINOv3, 2025); ZHANG et al.
(LPIPS, 2018); GOODFELLOW et al. (2014); LIPMAN et al. (flow matching, 2023); PEEBLES e XIE (DiT, 2023); RUSSAKOVSKY et al.
(ImageNet, 2015); WANG et al. (SSIM, 2004); HEUSEL et al.
(FID, 2018); SALIMANS et al. (Inception Score, 2016); SRIVASTAVA et al.
(2014); RIPPEL et al. (2014); FAN et al.
(2020); KUSUPATI et al. (2022); ZHU et al.
(2026); CIERNIK et al. (2026).




