O time DeepSeek-AI descreve no preprint DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression (arXiv:2609.19969) um modelo MoE multimodal com 552 bilhões de parâmetros de backbone. O contexto chega a um milhão de tokens.
A alegação central é que o KV cache global cai para cerca de 890 bytes por token. Isso equivale a aproximadamente um quarto do ocupado pelo DeepSeek-V4-Flash.
O cache persistente cai para cerca de um oitavo, com desempenho superior ao baseline em benchmarks agênticos.
A tese do artigo é simples. Com a atenção esparsa já reduzindo boa parte do custo computacional de sequências longas, o gargalo migrou para armazenamento e movimentação de dados.
O trabalho ataca esse gargalo em três frentes ao mesmo tempo: arquitetura, precisão de cache e estratégia de implantação.
O que os autores propõem
Os autores apresentam o DeepSeek-V4.1-Flash como um Transformer MoE multimodal que recebe imagens e texto e gera texto autoregressivamente. O backbone de linguagem tem 40 camadas causais.
São 20 camadas de encoder causal seguidas por 20 de decoder, mais 196 bilhões de parâmetros do módulo Engram de memória condicional. Cada camada combina atenção global e Sliding-Window Attention (SWA).
As duas primeiras usam apenas SWA.
O modelo ativa 8 bilhões de parâmetros por token durante o prefill e 16 bilhões durante o decode. Essa assimetria vem da arquitetura Causal Encoder-Decoder (CED).
Nela, o KV global do decoder é projetado a partir dos estados ocultos finais do encoder, o que permite que a maior parte dos tokens do prompt evite a computação completa do decoder.
As três alavancas principais de compressão são a Compressed Sparse Attention 2 (CSA2), com reuso cross-layer de KV global e de índices Top-K, o cache KV global em FP4, treinado desde o início, e o SWA Bounded Replay. Este último reconstrói aproximadamente os estados SWA faltantes reexecutando apenas os tokens mais recentes, em vez de persistir todo o cache local em SSD.
Os autores também simplificam a arquitetura do V4. Substituem o híbrido CSA–HCA por CSA2 puro e atualizam o módulo m HC para Single-Pass m HC.
Integram o Engram e adotam o decodificador especulativo DSpark, treinado separadamente após o pré-treinamento.
Contexto: qual problema está sendo atacado
O ponto de partida é o crescimento de agentes de horizonte longo, que tornam as cargas de trabalho cada vez mais pesadas em entrada. O prefill continua caro.
Caches KV grandes pressionam a capacidade de HBM e de SSD, além da banda de transferência de dados e de interconexão.
Os autores argumentam que computação, armazenamento e comunicação formam hoje o principal obstáculo para reduzir o custo de implantação. No DeepSeek-V4, o ramo de atenção global cobre todo o contexto e mantém o KV global, com main KV mais indexer K.
O SWA mantém estados locais.
Para uma janela fixa, o custo do SWA é limitado independentemente do comprimento da sequência. Em sequências suficientemente longas, o KV global domina o consumo em tempo de execução.
Há ainda o KV persistido para reuso de prefixo, restrito por SSD e memória do host. Segundo os autores, esses limites reduzem a vazão de serviço e encarecem a implantação de agentes com horizontes mais longos.
Como funciona
O CSA2 tem três modos atribuídos estaticamente. No modo Full, a camada gera KV global e realiza indexação.
No modo Reindex, ela reutiliza o KV global de uma camada precedente, mas usa seu próprio indexer Q para re-pontuar o indexer K compartilhado e selecionar novos índices Top-K.
No modo Reuse, reaproveita tanto o KV global quanto os índices Top-K da camada anterior e executa atenção esparsa diretamente. Em todos os modos, cada camada mantém seu próprio Q global e seu KV de SWA.
Compartilhar KV global e indexer K reduz armazenamento duplicado.
No decoder, um Hierarchical Sparse Indexer restringe indexadores posteriores a um conjunto de candidatos selecionado por um indexador anterior. A precisão FP4 no cache KV global é usada desde o treinamento, com o que os autores descrevem como degradação apenas marginal.
Somados, CSA2 e FP4 levam o cache global a cerca de um quarto do tamanho do DeepSeek-V4-Flash. No nível de implantação, o SWA Bounded Replay evita persistir o cache SWA em SSD ao custo de um pequeno volume de recomputação no prefill.
Isso reduz o cache persistente a aproximadamente um oitavo.
Os autores ainda relatam que, com todas as mudanças combinadas, o FLOPs de decode por token permanece quase constante entre comprimentos de contexto. Estender o contexto de 4K para 1M aumenta o custo em apenas cerca de um quarto, bem menos do que o observado no V4-Flash.
Cada camada em modo Reuse executa com 15 kernels no prefill e 11 no decode. O sistema de inferência separa o KV global de longa duração do KV de SWA de curta duração na memória do host.
A infraestrutura de treino inclui execução desagregada do encoder de visão, fatiamento balanceado de imagens e gestão de estado compartilhado entre estágios.
Resultados reportados
Segundo os autores, o DeepSeek-V4.1-Flash-Base alcança conhecimento de mundo, raciocínio e codificação comparáveis ao DeepSeek-V4-Pro-Base. Há ganhos de 5% a 10% em avaliações held-out, usando apenas um terço dos parâmetros totais e um quarto dos parâmetros ativados.
O pré-treinamento usou um corpus multimodal de 45 trilhões de tokens. A atenção esparsa foi treinada do zero a 64K de sequência, sem etapas de aquecimento com atenção densa.
Em raciocínio, o modelo sustenta alta acurácia em matemática e programação competitiva, em patamar comparável a modelos abertos de topo como Kimi-K3 e ao DeepSeek-V4-Pro. Em tarefas agênticas, os autores afirmam desempenho equiparável a modelos fechados de fronteira em Terminal-Bench 2.1, DeepSWE v1.1 e AutomationBench.
Os autores reconhecem uma lacuna em tarefas científicas como o Terminal-Bench 4.0, que exige conhecimento especializado. No domínio multimodal, o modelo superaria o Kimi-K3 em raciocínio visual e interpretação de gráficos profissionais.
Ainda assim, permanece uma diferença geral em relação a sistemas fechados de grande porte.
Os autores afirmam que o modelo completa mais de 95% das tarefas do mundo real, sem detalhar a metodologia dessa medição. Os checkpoints estão publicados no Hugging Face.
Limitações e o que não foi provado
Tudo o que está acima é relato dos autores, não resultado auditado por terceiros. O extrato disponível não traz números de latência, vazão, custo por token ou consumo energético.
São justamente as métricas que sustentariam a promessa de redução de custo de implantação.
Duas afirmações merecem leitura cuidadosa. A primeira é a de degradação "marginal" com FP4 no KV global.
O material não exibe a curva de perda nem a comparação com FP8 ou BF16 em todos os benchmarks.
A segunda é o SWA Bounded Replay, que por definição é uma reconstrução aproximada. Os autores dizem que a degradação é negligenciável, mas a exatidão do cache local é sacrificada.
Isso pode importar em tarefas em que a fidelidade do contexto é crítica.
Outros pontos em aberto: a lacuna em Terminal-Bench 4.0 e a diferença frente a sistemas fechados no multimodal. Falta detalhamento sobre a métrica dos "95% das tarefas reais".
O pós-treinamento não introduz inovação algorítmica, seguindo SFT, RL e destilação on-policy, o que torna difícil isolar o quanto dos ganhos vem da arquitetura e o quanto vem do pipeline de dados.
As comparações centrais são internas à família DeepSeek (V4-Flash e V4-Pro). O material não informa página de projeto.
Os identificadores fornecidos (arXiv 2609.19969, datado de setembro de 2026) não foram por nós conferidos em outras fontes.
Por que isso importa para quem constrói com IA
Para equipes brasileiras que operam agentes de horizonte longo, três implicações práticas se destacam. A primeira é econômica.
Se o KV global realmente cai para 890 bytes por token, o número de sessões simultâneas que cabem em um mesmo conjunto de GPUs cresce na mesma proporção.
O custo por tarefa agêntica, que costuma acumular dezenas de milhares de tokens de contexto, cai de forma relevante. Isso muda o cálculo de viabilidade de produtos que hoje são caros demais para rodar em escala, como varredura contínua de repositórios, automação de back-office e agentes de atendimento com histórico longo.
A segunda é arquitetural. Reuso cross-layer de KV, quantização em FP4 do cache e reconstrução aproximada de estados locais são técnicas que podem ser avaliadas independentemente do modelo, em implantações próprias.
O trade-off explícito entre armazenamento e recomputação de prefill é útil para quem projeta infraestrutura com restrição de SSD e banda, não só de VRAM.
A terceira é de soberania e acesso. Modelos abertos dessa classe, com suporte multimodal nativo e contexto de um milhão de tokens, ampliam a possibilidade de auto-hospedagem por organizações que não podem enviar dados sensíveis a APIs fechadas.
Nada disso deve ser tomado como fato consumado antes de replicação independente. O desenho descrito aponta com clareza para onde a fronteira de eficiência de contexto longo está se movendo.
Referências
- DeepSeek-AI et al. DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression. arXiv:2609.19969. https://arxiv.org/abs/2609.19969
- Checkpoints do modelo: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash




