Pesquisadores do projeto OmniEdu propõem uma família aberta de modelos de fundação para educação K-12, nas escalas 4B, 9B e 27B. A organização não gira em torno de acurácia de resposta, mas de quatro capacidades explícitas: competência de conteúdo, ancoragem curricular, raciocínio diagnóstico e ação pedagógica.
O argumento central dos autores é que utilidade educacional não se reduz a acertar a resposta. Um tutor precisa localizar o ponto de conhecimento, identificar a misconcepção por trás do erro e escolher a intervenção adequada.
O modelo de 27B reportado alcança 63,12% de EM e 76,69% de F1 no K12-Bench, 85,89% de acurácia no MathFish e 78,74% de win rate de scaffolding no MathTutorBench. A contribuição mais interessante, porém, é metodológica: uma taxonomia de capacidades que também organiza a construção dos dados de treino.
O que os autores propõem
Hao Liang, Qihan Lin, Meiyi Qiang, Linzhuang Sun, Hengyi Feng, Mingrui Chen, Sizhe Qiu e Wentao Zhang descrevem o OmniEdu como uma família aberta de modelos de fundação para aprendizagem e ensino. O projeto tem três compromissos declarados: uma taxonomia de capacidades educacionais, um pipeline reproduzível de construção de dados orientado a capacidades e uma avaliação cruzada entre currículo, resolução de problemas e tutoria pedagógica.
A taxonomia é o eixo do trabalho e divide a supervisão educacional em quatro categorias. Subject competence cobre resolver problemas K-12 e explicar respostas em matemática, ciências, leitura e escrita. Curriculum grounding trata do alinhamento a pontos de conhecimento, nível escolar, dificuldade, pré-requisitos e localização curricular.
Diagnostic reasoning identifica erros e misconcepções no trabalho do estudante e infere pré-requisitos ausentes. Pedagogical action and scaffolding seleciona e executa uma intervenção: dica, pergunta, revisão de pré-requisito ou explicação direta.
Os autores enquadram a contribuição como resposta a uma lacuna específica. Existem modelos que acertam a resposta e modelos que conversam de forma socrática, mas faltaria uma família aberta cujo objetivo de treino e protocolo de avaliação sejam organizados em torno do ciclo completo de aprender e ensinar.
O projeto está disponível na página do projeto e o paper pode ser consultado no arXiv.
Contexto: qual problema está sendo atacado
A crítica dos autores é direta: tratar educação como perguntas e respostas comuns descarta a estrutura que torna a tutoria eficaz. Um modelo pode obter a resposta certa e ainda assim falhar em localizar o conceito curricular relevante, explicar o erro ou oferecer um andaime que preserve a oportunidade de o estudante raciocinar.
O texto relaciona trabalhos que resolveram apenas partes do problema. EduChat cobre interações amplas, MuduoLLM é alinhado ao currículo chinês de K-12, Confucius3-Math especializa-se em raciocínio matemático.
Do lado de sistemas de fronteira, LearnLM formula a adaptação educacional como pedagogical instruction following, e produtos como ChatGPT Study Mode e Khanmigo enfatizam raciocínio guiado.
A objeção dos autores é que muitos desses sistemas permanecem fechados ou dependem de orquestração em nível de produto, dificultando reprodução e extensão.
Há também uma dívida com a literatura data-centric. LIMA, AlpaGasus, Deita e LESS já mostraram que qualidade, diversidade e relevância de capacidade importam mais que escala bruta.
Trabalhos educacionais como Instruction Tuning with Human Curriculum, K12-KGraph e EDUMATH incorporam estrutura curricular, mas geralmente em uma tarefa, disciplina ou capacidade isolada. OmniEdu se posiciona como a extensão dessas ideias a uma mistura unificada.
Como funciona
O pipeline tem seis estágios. O primeiro é a taxonomia de capacidades e coleta de fontes.
O segundo é limpeza determinística e descontaminação em relação às avaliações. O terceiro é auditoria semântica e reescrita assistidas por LLM.
O quarto estágio é seleção preliminar de diversidade e filtragem fina de qualidade. O quinto é seleção de diversidade com orçamento de tokens.
O sexto é atribuição de instruções pedagógicas e montagem final.
Os números são o ponto mais concreto do paper. Partindo de mais de 100 datasets e recursos educacionais, os autores chegam a um pool inicial de aproximadamente 1,34 milhão de exemplos, que é reduzido a 60.951 exemplos de alta qualidade, contendo cerca de 12,0 milhões de tokens de resposta supervisionada.
A esse conjunto somam-se 9.048 exemplos de instrução geral, provenientes de DataFlow-Instruct-10K (7.431), Tulu-3-SFT-mixture (1.495) e MathV360K (122). Foram escolhidos para preservar seguimento de instruções, cobertura multilíngue, comportamento de recusa e raciocínio sobre diagramas.
Cada exemplo é atribuído a uma única capacidade primária, conforme seu objetivo principal de supervisão, com propriedades secundárias retidas como metadados. Dentro de cada capacidade há subdivisões por forma de tarefa, modalidade e tipo de supervisão.
O passo final anexa uma entre 20 instruções de sistema pedagógicas específicas de tarefa a cada exemplo selecionado. A mistura resultante tem 69.999 exemplos e 15,96 milhões de tokens de resposta supervisionada, com proveniência e metadados de auditoria mantidos ao longo de todo o processo.
A ideia de separar o conteúdo do exemplo do comportamento de resposta que ele ensina é o que permite ao mesmo modelo servir tanto a interações orientadas a resposta quanto a andaimes.
Resultados reportados
Os autores avaliam em três dimensões: ancoragem curricular, resolução de problemas K-12 e tutoria pedagógica. Os benchmarks incluem K12-Bench, MathFish e EDUMATH para currículo; GAOKAO-Bench, EXAMS-V e MDK12-Bench para problemas escolares autênticos; e MathTutorBench, TutorBench e LongTutor para tutoria, feedback, explicação adaptativa e modelagem longitudinal do estudante.
Também medem seguimento de instruções gerais, raciocínio científico e compreensão multimodal como checagem auxiliar.
O OmniEdu-27B obtém 63,12% de EM e 76,69% de F1 no K12-Bench, 85,89% de acurácia no MathFish e 86,95% de MaC no EDUMATH. Em tutoria, alcança 78,74% de win rate de scaffolding no MathTutorBench e média de ensino de 3,02 no LongTutor.
Mantém-se competitivo com sistemas proprietários substancialmente maiores em várias avaliações de resolução de problemas K-12.
Os autores afirmam que o tuning educacional melhora todas as escalas (4B, 9B, 27B) nas três dimensões. Dizem ainda que os ganhos não se limitam a respostas mais corretas: aparecem também em raciocínio curricular, ensino sensível a erros e uso do histórico do estudante.
Limitações e o que não foi provado
O extrato disponível cobre introdução, trabalho relacionado e início da preparação de dados. Não inclui uma seção de limitações nem o protocolo completo de avaliação.
Isso deixa vários pontos em aberto para quem lê apenas esse material.
Primeiro, os resultados são comparações entre configurações de treino dos próprios autores e contra sistemas de referência. O texto não detalha, no trecho disponível, intervalos de confiança, variância entre execuções ou significância estatística das diferenças.
Isso é relevante quando se reporta win rate de scaffolding (78,74%) em avaliação julgada por modelo.
Segundo, "win rate" em MathTutorBench e a média de 3,02 em LongTutor dependem do desenho do juiz e dos critérios de avaliação, que não estão descritos aqui. Ganhos em preferência pedagógica não equivalem automaticamente a ganhos de aprendizagem humana.
Terceiro, não há no material evidência de estudo com estudantes reais, retenção de conhecimento, ganhos de desempenho pós-intervenção ou efeitos de longo prazo em sala de aula. O LongTutor avalia modelagem longitudinal do estudante, não resultados educacionais medidos em campo.
A cobertura é declaradamente K-12 e centrada em matemática, ciências, leitura e escrita. O comportamento em ensino superior, educação profissional ou contextos multilíngues específicos do Brasil não é examinado.
E, sendo um pipeline que usa LLMs para auditoria e reescrita, há risco de herdar os vieses e erros dos modelos auditores. Os autores descrevem controles, mas o extrato não quantifica esse resíduo.
Por que isso importa para quem constrói com IA
Para times que desenvolvem produtos educacionais no Brasil, o paper oferece duas coisas úteis. A primeira é uma taxonomia operacional: separar competência de conteúdo, ancoragem curricular, diagnóstico e ação pedagógica dá um vocabulário comum para especificar dados de treino, prompts de sistema e critérios de avaliação.
Isso é prático mesmo sem fine-tuning, e pode virar rubrica de anotação e de teste.
A segunda é a evidência sobre composição de dados. O salto de 1,34 milhão para 60.951 exemplos, com orçamento de tokens e seleção por diversidade, reforça teses já estabelecidas na literatura data-centric e as aplica a um domínio com estrutura própria.
Quem trabalha com adaptação de modelos abertos deve ler esse pipeline como um roteiro replicável, disponível publicamente na página do projeto.
Há também um alerta: scaffolding e resposta direta são comportamentos diferentes. Misturá-los por fonte ou disciplina, sem alvo explícito, tende a borrar a política de resposta que o modelo aprende, exatamente o problema que os autores dizem estar atacando.
E, para o contexto brasileiro, falta o trabalho que ainda não foi feito: currículo local, BNCC, língua portuguesa e as avaliações nacionais não aparecem na mistura reportada.
Referências
LIANG, Hao; LIN, Qihan; QIANG, Meiyi; SUN, Linzhuang; FENG, Hengyi; CHEN, Mingrui; QIU, Sizhe; ZHANG, Wentao. OmniEdu: Open Foundation Models for Learning and Teaching. arXiv:2609.23088, 2026. Disponível em: https://arxiv.org/abs/2609.23088.
Acesso em: 2026.
OMNIEDU. Página do projeto. Disponível em: https://haolpku.github.io/Omni-Edu/.
Acesso em: 2026.




