O ZGCM-1 é um modelo de fundação denso de 7,39 bilhões de parâmetros. Foi treinado do zero e liberado de forma integralmente aberta.
A tese central é que modelos compactos não conseguem memorizar passivamente a web aberta. Mas podem contornar o limite de capacidade paramétrica acoplando pensamento interno deliberado a uso ativo de ferramentas externas.
Os autores são Jiyan He, Guang Liang, Hao Liu e colegas. Eles relatam 75,0% no AIME 2026, 97,1% no MATH-500, 70,4% no HMMT 2025 e 63,1% no WebWalkerQA.
Também reportam melhoria de aproximadamente 4,2x no tempo-até-perda do pré-treinamento em contexto de 16K.
O trabalho está descrito no paper arXiv 2609.13356. Os artefatos foram publicados no repositório do projeto.
Há divulgação adicional na página do projeto.
O que os autores propõem
A proposta tem quatro componentes. O primeiro é uma arquitetura de atenção híbrida.
Ela intercala atenção de janela deslizante com portão (gated SWA) e atenção global na razão 5:1.
O segundo é um co-design de sistema e algoritmo. Combina o otimizador Muon, precisão híbrida FP8 e a regularização de outliers TWEO.
Alcança o ganho de 4,2x em tempo-até-perda sobre uma linha de base AdamW/BF16.
O terceiro é um mid-training curricular. Escala o contexto progressivamente ao longo de 600 bilhões de tokens, de 16K para 64K e depois 256K.
Reformula traços de interação como transições de estado-ação de um Processo de Decisão Markoviano (MDP). Isso fornece supervisão densa em nível de passo.
O quarto é um alinhamento misto de fine-tuning com modos "think/no-think". É aplicado sobre trajetórias verificadas por execução.
Os autores também propõem um fluxo de P&D nativo em IA. Nele, enxames de agentes gerenciam de forma autônoma operações de cluster, curadoria de dados e avaliação diagnóstica rápida.
Eles anunciam a destilação de oito achados empíricos ao longo do ciclo de desenvolvimento. Os achados cobrem escalonamento arquitetural, poda de qualidade em SFT, generalização de contexto longo e dinâmica de co-treinamento agêntico.
Contexto: qual problema está sendo atacado
Os autores organizam o problema em duas barreiras. A primeira é a barreira de escala.
Raciocínio de fronteira e busca agêntica profunda são vistos como território exclusivo de sistemas com centenas de bilhões de parâmetros. Isso exclui pesquisadores com orçamento computacional restrito.
A segunda é a barreira de opacidade. A maioria dos modelos competitivos é liberada apenas como pesos abertos, não como código-fonte e receita completos.
Receitas de filtragem a montante, currículos de mid-training, cronogramas de contexto longo e traços multi-turno de agentes permanecem caixas-pretas proprietárias. Isso impede o estudo sistemático da dinâmica de treinamento e dos limites de capacidade.
É contra esse pano de fundo que os autores posicionam a contribuição. Eles liberam pesos das etapas de pré-treinamento, mid-training e pós-treinamento.
Também liberam checkpoints intermediários, código de treinamento, dados por estágio e receitas de dados, logs do W&B e harnesses de avaliação.
Como funciona
O modelo segue uma arquitetura Transformer decoder-only com Grouped-Query Attention, RMSNorm, ativação SwiGLU e RoPE. São 32 camadas, dimensão oculta de 4.096, dimensão intermediária SwiGLU de 11.008, 32 cabeças de consulta e 8 de chave-valor com dimensão 128.
O contexto máximo é de 256K tokens.
Das 32 camadas, 27 usam gated SWA com janela de 128 tokens. Cinco usam atenção causal global, nas camadas 6, 12, 18, 24 e 30.
São cinco blocos repetidos de cinco camadas locais seguidas de uma global, mais duas locais ao final. Há normalização QK via RMSNorm e Partial RoPE com fração rotatória de 0,33.
A seleção da configuração de atenção foi feita por experimentos controlados. Foram testadas atenção completa, GQA com FlashAttention-2, MLA e três cronogramas SWA (1:1, 3:1 e 5:1).
Todos foram treinados por 10 bilhões de tokens com sequências de 4.096 em oito GPUs H100.
O SWA 5:1 atingiu a maior vazão, 9.566 tokens/s/GPU, com perda final de 1,93. Empatou com a linha de base de atenção completa.
O SWA 3:1 chegou a 1,92 de perda com vazão ligeiramente menor. O MLA ficou em 7.645 tokens/s/GPU sem ganho de perda correspondente.
À medida que o contexto cresce de 4K a 256K, a vantagem de vazão do SWA 5:1 sobre atenção completa se amplia. Chega a 3,94x em 256K.
No lado de memória, o cache KV por token cai de 128 KiB (atenção completa) para 20 KiB. Em uma comparação entre arquiteturas isoparamétricas em 256K de contexto, a atenção completa exigiria 32,0 GiB de cache KV.
Uma linha de base de atenção linear GDN 3:1 exigiria 7,0 GiB. O híbrido dos autores exige apenas 5,0 GiB, redução de 6,4x.
O pré-treinamento geral ocorre em duas etapas de dados. A Etapa 1 tem cerca de 0,99 trilhão de tokens.
A Etapa 2 tem 3,20 trilhões. Antes delas, houve busca de mistura com um modelo-proxy de 0,3 bilhão de parâmetros treinado em aproximadamente 30 bilhões de tokens.
As fontes incluem web curada em inglês com alocação controlada de dados em chinês, PDFs educacionais, conteúdo científico extraído por OCR, corpora de código, matemática filtrada, papers em LaTeX do RedPajama-1T e dados especializados de raciocínio do Nemotron-Pretraining-Specialized-v1. A tokenização usa o tokenizer do GLM-5.1.
Resultados reportados
Segundo os autores, o ZGCM-1-7B fica em primeiro lugar na média de 14 benchmarks de raciocínio na faixa de 7B–8B. Tem 75,0% no AIME 2026, 97,1% no MATH-500 e 70,4% no HMMT 2025.
Em busca agêntica e agência de sistema, reportam 63,1% no WebWalkerQA, 19,4% no BrowseComp e 62,0% no Binary Function Search. Os autores descrevem esses números como competitivos com modelos de fronteira ordens de magnitude maiores.
Citam Qwen3-235B-A22B, GLM-5.1, Claude 4 Sonnet e Kimi-K2.
Em benchmarks gerais, o desempenho é descrito como competitivo dentro da família de 7B. A avaliação total cobre 20 benchmarks.
Limitações e o que não foi provado
O material disponível não traz números absolutos em todos os 20 benchmarks, nem margens de erro ou variância entre execuções. As afirmações de paridade com modelos de fronteira se apoiam em conjuntos específicos de tarefas.
O BrowseComp em 19,4% indica que a busca agêntica aberta continua sendo um gargalo real, não resolvido.
Os ganhos de eficiência, 4,2x em tempo-até-perda e 3,94x de vazão em 256K, foram medidos sob configurações específicas. Usaram oito GPUs H100 e orçamentos fixos.
Não necessariamente se transferem para outras pilhas de hardware ou estratégias de paralelismo.
A avaliação do fluxo de P&D nativo em IA vem de nove colaboradores centrais do próprio projeto. Caracteriza autonomia maior em experimentação, monitoramento e implantação, mas menor em design de arquitetura e algoritmos de aprendizado.
É um autorrelato de limites, não uma medição independente.
Os autores também não detalham no material disponível os custos totais de computação, a composição licenciada das fontes de dados, ou resultados de segurança, alinhamento e robustez adversária. Os oito achados empíricos são anunciados como destilação do ciclo de desenvolvimento.
Mas o extrato consultado não os lista integralmente, o que impede verificar cada um deles.
Por que isso importa para quem constrói com IA
Para equipes que implantam LLMs em produção, o argumento mais transferível não é o ranking em benchmarks. É a economia de inferência em contexto longo.
Um cache KV de 20 KiB por token contra 128 KiB, e 5,0 GiB contra 32,0 GiB em 256K, muda a aritmética de memória de qualquer serviço que opere com histórico extenso.
Isso vale para agentes que acumulam traços de ferramentas, RAG com muitos documentos, ou raciocínio de horizonte longo. Como a decodificação autorregressiva é limitada por largura de banda de memória, essa redução tende a aparecer diretamente na vazão.
O segundo ponto relevante é metodológico. A reformulação de traços de interação como transições de MDP sugere uma forma de extrair supervisão densa de logs de agentes já existentes.
É um recurso que muitas equipes têm em abundância e subutilizam.
A liberação de checkpoints intermediários e logs de treinamento permite estudar dinâmica de treino em escala acadêmica. Isso é raro mesmo entre modelos com pesos abertos.
Resta saber se a combinação de pensamento interno e busca externa se sustenta fora dos conjuntos avaliados. A direção é plausível para quem precisa de raciocínio confiável com orçamento limitado.
Referências
- HE, Jiyan; LIANG, Guang; LIU, Hao et al. ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search. arXiv:2609.13356, cs.AI, 2026.
- Repositório oficial com pesos, código, receitas de dados e logs: GitHub.com/zgcagi/ZGCM-1.
- Página de divulgação do projeto: mp.weixin.qq.com/s/kzScxJki8hY2IHIl32l5cQ.




