Modelos de atenção linear trocam o KV cache crescente por um estado recorrente de tamanho fixo. Esse estado vira gargalo quando muitas requisições são atendidas ao mesmo tempo.
No technical report STEPQuant, Bingchen Yao, Haobo Xu, Haokun Lin, Yichen Wu, Ziyu Guo, Renrui Zhang, Zhichao Lu, Zhenan Sun e Ying Wei argumentam que a quantização ingênua desses estados falha.
O erro tem duas dimensões mensuráveis: quando ele persiste (tempo) e onde ele ocorre (espaço). A partir disso, os autores propõem um framework de quantização pós-treino.
Segundo eles, o método iguala a acurácia do estado em FP32 com orçamento nominal de 6 bits. A memória do estado recorrente cai mais de 5x.
O que os autores propõem
O STEPQuant é um framework de quantização pós-treino (PTQ) "espacial-temporal" para estados recorrentes regidos pela regra Delta com gate. Ele combina duas peças.
A primeira, Lifetime-aware Bit Allocation, distribui precisão entre unidades do estado. Cada unidade é um head inteiro no Qwen e uma linha de chave no KDA.
A alocação minimiza uma distorção de reconstrução ponderada pelo tempo de vida da memória, sob um orçamento fixo de bits. Unidades de risco mais alto ficam em FP16 como "pivôs esparsos".
A segunda peça, Key-Row-Aware Dual-Axis Fitting, atribui escalas separadas para linhas de chave e colunas de valor. A escala de linha considera a magnitude atual da linha e um row-impact score.
Esse score mede o quanto o erro naquela linha contamina a saída. A escala de coluna é ajustada com peso maior nas linhas onde o erro importa mais.
Os autores reportam integração no SGLang com kernels de GPU otimizados. O código está em GitHub.com/Dreamer-Toby/STEPQuant.
Contexto: qual problema está sendo atacado
Atenção linear resume tokens passados em uma matriz de estado de tamanho fixo, em vez de um KV cache que cresce com a sequência (Yang et al., 2023). Modelos híbridos recentes, como Qwen3.8-27B (Qwen Team, 2026d) e Kimi-Linear-48B-A3B-Instruct (Team et al., 2025), combinam memória recorrente com regra Delta com gate (Yang et al., 2025) e atenção softmax padrão.
O GDN usa um gate escalar por head. O KDA usa gates por canal.
O problema é de serving, não de arquitetura. Cada requisição concorrente exige um estado persistente próprio, e sistemas de serving ainda reservam slots extras para cache e escalonamento.
O pool de estados cresce com a concorrência mesmo em contextos curtos.
Os autores medem que, no deployment oficial em SGLang, o pool de estados em FP32 do Qwen ultrapassa o footprint de memória dos próprios pesos em BF16 a partir de 70 requisições concorrentes.
Quantizar diretamente esses estados degrada o modelo. Cada passo de decodificação atualiza um estado que já é aproximado e o requantiza, e o erro se realimenta.
Os autores mostram queda acentuada de acurácia média em 4 e 6 bits nos dois modelos, com lacuna visível até em 8 bits. É a motivação central do trabalho, detalhado em arXiv.org/abs/2609.38169.
Como funciona
Na dimensão temporal, a Proposition 1 dos autores caracteriza a propagação do erro. O erro acumulado é transportado pela atualização e atenuado pelo gate de retenção.
O componente alinhado à chave corrente é reduzido por um fator ligado à força de escrita, enquanto componentes ortogonais permanecem inalterados. Quando a retenção é próxima de um, erros fora da direção das chaves seguintes podem persistir por muitos passos.
A validação empírica avaliou todos os heads recorrentes do Qwen3.8-27B sob quantização uniforme INT6 do estado no dataset C4. Heads com meia-vida de gate maior exibem erro acumulado maior, com correlação de Spearman reportada.
O peso de tempo de vida decai aproximadamente de forma exponencial. A alocação de bits minimiza a soma dessa distorção ponderada.
Na dimensão espacial, os autores derivam o erro de leitura (readout) como uma soma ponderada dos erros por linha de chave. Daí definem um row-impact score por linha.
Para validá-lo, ranquearam as linhas de chave de cada head por esse score, dividiram-nas em oito grupos e quantizaram um grupo por vez em INT4, mantendo o restante em precisão total. Grupos com score maior produziram maior degradação de perplexidade nos dois modelos.
A segunda observação espacial é geométrica. Cenários clássicos de quantização de LLMs tratam outliers ao longo de um eixo dominante (Xiao et al., 2023; Shao et al., 2024).
Os estados recorrentes apresentam estruturas de grande magnitude tanto em linhas de chave quanto em colunas de valor. Esse padrão persiste ao longo da decodificação: os contrastes máximo/mediana de RMS nos dois eixos superam o limiar analisado em 98,6% dos estados amostrados.
Daí o escalonamento em dois eixos, com suavização por raiz quadrada e normalização. A normalização faz a média geométrica dos fatores de linha ser um, o que preserva a importância relativa entre linhas.
Resultados reportados
Os experimentos cobrem Qwen3.8-27B e Kimi-Linear-48B-A3B-Instruct em sete tarefas de geração longa e seis de geração curta. Sob orçamento nominal de 6 bits, os autores afirmam que o STEPQuant se aproxima bastante da acurácia com estado em FP32 nos dois modelos.
Na configuração de 4 bits, ele superaria a quantização uniforme INT8 em ambos, quase igualando o FP32 no Qwen e mantendo lacuna modesta no Kimi.
Em serving, com kernels otimizados integrados ao SGLang, o STEPQuant de 6 bits alcança compressão de 5,03x e 5,08x na memória do estado recorrente. Reduz o consumo total de memória de serving em até 68,7% e 53,7% (Qwen e Kimi, respectivamente) e acelera atualizações de estado em até 2,91x.
Esses números são relatados pelos autores e não foram reproduzidos de forma independente nesta análise.
Limitações e o que não foi provado
O escopo é estreito em diversidade: dois modelos, ambos híbridos com memória Delta com gate. O material não demonstra generalização para outras variantes de atenção linear, para arquiteturas sem camadas softmax combinadas, nem para modelos menores.
A análise teórica também é condicional: a Proposition 1 parte da premissa de entradas e gates idênticos, uma idealização que não corresponde exatamente ao regime de quantização com erro realimentado.
A calibração é offline e fixa entre requisições. A alocação de bits e a escolha dos pivôs são determinadas uma vez e congeladas.
O extrato disponível não responde como o método se comporta sob desvio de distribuição em sessões muito longas ou cargas heterogêneas.
Manter as unidades de maior risco em FP16 significa que a economia efetiva não é puramente de 6 bits. O próprio termo "nominal" no resumo sugere que há overhead embutido na conta.
Os ganhos de serving estão amarrados à implementação em SGLang com kernels próprios. Não há, no material analisado, avaliação de interação com outras técnicas de compressão aplicadas simultaneamente, de cargas multi-turno do tipo agente, nem comparação com estados em BF16 como referência de custo-benefício.
Também não se discute custo de calibração em tempo de engenharia.
Por que isso importa para quem constrói com IA
Para quem opera inferência no Brasil, com GPUs contadas e pressão por concorrência, o ponto central do STEPQuant não é o número de bits. É a virada de enquadramento.
Quantização deixa de ser uma decisão uniforme e global e passa a ser um problema de alocação de recurso com base em medição. Quais partes do estado envelhecem carregando erro, e quais partes desse erro efetivamente chegam à saída.
Isso tem consequência prática direta em serving. Em modelos híbridos, o pool de estados recorrentes cresce com o número de requisições simultâneas, independentemente do tamanho do contexto.
É o tipo de gargalo que limita o throughput de um agente conversacional de geração longa rodando em hardware modesto, e que não se resolve apenas reduzindo o tamanho do modelo. Reduzir o estado em mais de 5x, sem retreinar e com integração a um runtime já usado em produção, muda a conta de quantos usuários simultâneos cabem por GPU.
O trabalho também serve como modelo mental reaproveitável. Antes de comprimir, meça a estrutura do erro nas dimensões em que ela se organiza.
Aqui, tempo de vida da memória e impacto espacial na leitura. Essa abordagem tende a render mais do que aplicar uma receita de quantização herdada de pesos estáticos.
Estados recorrentes são, por construção, objetos que evoluem e acumulam história.
Referências
- Yao, B.; Xu, H.; Lin, H.; Wu, Y.; Guo, Z.; Zhang, R.; Lu, Z.; Sun, Z.; Wei, Y. STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization. Technical Report, arXiv:2609.38169. Disponível em arXiv.org/abs/2609.38169.
- Código dos autores: GitHub.com/Dreamer-Toby/STEPQuant.
- Yang et al. (2023), atenção linear e estado recorrente de tamanho fixo.
- Yang et al. (2025), Gated DeltaNet (GDN).
- Team et al. (2025), Kimi Delta Attention (KDA) e Kimi-Linear-48B-A3B-Instruct.
- Qwen Team (2026d), Qwen3.8-27B.
- Dettmers et al. (2022, 2023), quantização de LLMs com precisão mista.
- Xiao et al. (2023), SmoothQuant; Shao et al. (2024), quantização com outliers em eixo único.
- Dataset de calibração e avaliação citado: C4.




