OmniEdu: modelos abertos que unem ensino e aprendizagem em K-12

shape
shape
shape
shape
shape

OmniEdu: modelos abertos que unem ensino e aprendizagem em K-12

OmniEdu: modelos abertos que unem ensino e aprendizagem em K-12

Pesquisadores do projeto OmniEdu propõem uma família aberta de modelos de fundação para educação K-12, nas escalas 4B, 9B e 27B. A organização não gira em torno de acurácia de resposta, mas de quatro capacidades explícitas: competência de conteúdo, ancoragem curricular, raciocínio diagnóstico e ação pedagógica.

O argumento central dos autores é que utilidade educacional não se reduz a acertar a resposta. Um tutor precisa localizar o ponto de conhecimento, identificar a misconcepção por trás do erro e escolher a intervenção adequada.

O modelo de 27B reportado alcança 63,12% de EM e 76,69% de F1 no K12-Bench, 85,89% de acurácia no MathFish e 78,74% de win rate de scaffolding no MathTutorBench. A contribuição mais interessante, porém, é metodológica: uma taxonomia de capacidades que também organiza a construção dos dados de treino.

O que os autores propõem

Hao Liang, Qihan Lin, Meiyi Qiang, Linzhuang Sun, Hengyi Feng, Mingrui Chen, Sizhe Qiu e Wentao Zhang descrevem o OmniEdu como uma família aberta de modelos de fundação para aprendizagem e ensino. O projeto tem três compromissos declarados: uma taxonomia de capacidades educacionais, um pipeline reproduzível de construção de dados orientado a capacidades e uma avaliação cruzada entre currículo, resolução de problemas e tutoria pedagógica.

A taxonomia é o eixo do trabalho e divide a supervisão educacional em quatro categorias. Subject competence cobre resolver problemas K-12 e explicar respostas em matemática, ciências, leitura e escrita. Curriculum grounding trata do alinhamento a pontos de conhecimento, nível escolar, dificuldade, pré-requisitos e localização curricular.

Diagnostic reasoning identifica erros e misconcepções no trabalho do estudante e infere pré-requisitos ausentes. Pedagogical action and scaffolding seleciona e executa uma intervenção: dica, pergunta, revisão de pré-requisito ou explicação direta.

Os autores enquadram a contribuição como resposta a uma lacuna específica. Existem modelos que acertam a resposta e modelos que conversam de forma socrática, mas faltaria uma família aberta cujo objetivo de treino e protocolo de avaliação sejam organizados em torno do ciclo completo de aprender e ensinar.

O projeto está disponível na página do projeto e o paper pode ser consultado no arXiv.

Contexto: qual problema está sendo atacado

A crítica dos autores é direta: tratar educação como perguntas e respostas comuns descarta a estrutura que torna a tutoria eficaz. Um modelo pode obter a resposta certa e ainda assim falhar em localizar o conceito curricular relevante, explicar o erro ou oferecer um andaime que preserve a oportunidade de o estudante raciocinar.

O texto relaciona trabalhos que resolveram apenas partes do problema. EduChat cobre interações amplas, MuduoLLM é alinhado ao currículo chinês de K-12, Confucius3-Math especializa-se em raciocínio matemático.

Do lado de sistemas de fronteira, LearnLM formula a adaptação educacional como pedagogical instruction following, e produtos como ChatGPT Study Mode e Khanmigo enfatizam raciocínio guiado.

A objeção dos autores é que muitos desses sistemas permanecem fechados ou dependem de orquestração em nível de produto, dificultando reprodução e extensão.

Há também uma dívida com a literatura data-centric. LIMA, AlpaGasus, Deita e LESS já mostraram que qualidade, diversidade e relevância de capacidade importam mais que escala bruta.

Trabalhos educacionais como Instruction Tuning with Human Curriculum, K12-KGraph e EDUMATH incorporam estrutura curricular, mas geralmente em uma tarefa, disciplina ou capacidade isolada. OmniEdu se posiciona como a extensão dessas ideias a uma mistura unificada.

Como funciona

O pipeline tem seis estágios. O primeiro é a taxonomia de capacidades e coleta de fontes.

O segundo é limpeza determinística e descontaminação em relação às avaliações. O terceiro é auditoria semântica e reescrita assistidas por LLM.

O quarto estágio é seleção preliminar de diversidade e filtragem fina de qualidade. O quinto é seleção de diversidade com orçamento de tokens.

O sexto é atribuição de instruções pedagógicas e montagem final.

Os números são o ponto mais concreto do paper. Partindo de mais de 100 datasets e recursos educacionais, os autores chegam a um pool inicial de aproximadamente 1,34 milhão de exemplos, que é reduzido a 60.951 exemplos de alta qualidade, contendo cerca de 12,0 milhões de tokens de resposta supervisionada.

A esse conjunto somam-se 9.048 exemplos de instrução geral, provenientes de DataFlow-Instruct-10K (7.431), Tulu-3-SFT-mixture (1.495) e MathV360K (122). Foram escolhidos para preservar seguimento de instruções, cobertura multilíngue, comportamento de recusa e raciocínio sobre diagramas.

Cada exemplo é atribuído a uma única capacidade primária, conforme seu objetivo principal de supervisão, com propriedades secundárias retidas como metadados. Dentro de cada capacidade há subdivisões por forma de tarefa, modalidade e tipo de supervisão.

O passo final anexa uma entre 20 instruções de sistema pedagógicas específicas de tarefa a cada exemplo selecionado. A mistura resultante tem 69.999 exemplos e 15,96 milhões de tokens de resposta supervisionada, com proveniência e metadados de auditoria mantidos ao longo de todo o processo.

A ideia de separar o conteúdo do exemplo do comportamento de resposta que ele ensina é o que permite ao mesmo modelo servir tanto a interações orientadas a resposta quanto a andaimes.

Resultados reportados

Os autores avaliam em três dimensões: ancoragem curricular, resolução de problemas K-12 e tutoria pedagógica. Os benchmarks incluem K12-Bench, MathFish e EDUMATH para currículo; GAOKAO-Bench, EXAMS-V e MDK12-Bench para problemas escolares autênticos; e MathTutorBench, TutorBench e LongTutor para tutoria, feedback, explicação adaptativa e modelagem longitudinal do estudante.

Também medem seguimento de instruções gerais, raciocínio científico e compreensão multimodal como checagem auxiliar.

O OmniEdu-27B obtém 63,12% de EM e 76,69% de F1 no K12-Bench, 85,89% de acurácia no MathFish e 86,95% de MaC no EDUMATH. Em tutoria, alcança 78,74% de win rate de scaffolding no MathTutorBench e média de ensino de 3,02 no LongTutor.

Mantém-se competitivo com sistemas proprietários substancialmente maiores em várias avaliações de resolução de problemas K-12.

Os autores afirmam que o tuning educacional melhora todas as escalas (4B, 9B, 27B) nas três dimensões. Dizem ainda que os ganhos não se limitam a respostas mais corretas: aparecem também em raciocínio curricular, ensino sensível a erros e uso do histórico do estudante.

Limitações e o que não foi provado

O extrato disponível cobre introdução, trabalho relacionado e início da preparação de dados. Não inclui uma seção de limitações nem o protocolo completo de avaliação.

Isso deixa vários pontos em aberto para quem lê apenas esse material.

Primeiro, os resultados são comparações entre configurações de treino dos próprios autores e contra sistemas de referência. O texto não detalha, no trecho disponível, intervalos de confiança, variância entre execuções ou significância estatística das diferenças.

Isso é relevante quando se reporta win rate de scaffolding (78,74%) em avaliação julgada por modelo.

Segundo, "win rate" em MathTutorBench e a média de 3,02 em LongTutor dependem do desenho do juiz e dos critérios de avaliação, que não estão descritos aqui. Ganhos em preferência pedagógica não equivalem automaticamente a ganhos de aprendizagem humana.

Terceiro, não há no material evidência de estudo com estudantes reais, retenção de conhecimento, ganhos de desempenho pós-intervenção ou efeitos de longo prazo em sala de aula. O LongTutor avalia modelagem longitudinal do estudante, não resultados educacionais medidos em campo.

A cobertura é declaradamente K-12 e centrada em matemática, ciências, leitura e escrita. O comportamento em ensino superior, educação profissional ou contextos multilíngues específicos do Brasil não é examinado.

E, sendo um pipeline que usa LLMs para auditoria e reescrita, há risco de herdar os vieses e erros dos modelos auditores. Os autores descrevem controles, mas o extrato não quantifica esse resíduo.

Por que isso importa para quem constrói com IA

Para times que desenvolvem produtos educacionais no Brasil, o paper oferece duas coisas úteis. A primeira é uma taxonomia operacional: separar competência de conteúdo, ancoragem curricular, diagnóstico e ação pedagógica dá um vocabulário comum para especificar dados de treino, prompts de sistema e critérios de avaliação.

Isso é prático mesmo sem fine-tuning, e pode virar rubrica de anotação e de teste.

A segunda é a evidência sobre composição de dados. O salto de 1,34 milhão para 60.951 exemplos, com orçamento de tokens e seleção por diversidade, reforça teses já estabelecidas na literatura data-centric e as aplica a um domínio com estrutura própria.

Quem trabalha com adaptação de modelos abertos deve ler esse pipeline como um roteiro replicável, disponível publicamente na página do projeto.

Há também um alerta: scaffolding e resposta direta são comportamentos diferentes. Misturá-los por fonte ou disciplina, sem alvo explícito, tende a borrar a política de resposta que o modelo aprende, exatamente o problema que os autores dizem estar atacando.

E, para o contexto brasileiro, falta o trabalho que ainda não foi feito: currículo local, BNCC, língua portuguesa e as avaliações nacionais não aparecem na mistura reportada.

Referências

LIANG, Hao; LIN, Qihan; QIANG, Meiyi; SUN, Linzhuang; FENG, Hengyi; CHEN, Mingrui; QIU, Sizhe; ZHANG, Wentao. OmniEdu: Open Foundation Models for Learning and Teaching. arXiv:2609.23088, 2026. Disponível em: https://arxiv.org/abs/2609.23088.

Acesso em: 2026.

OMNIEDU. Página do projeto. Disponível em: https://haolpku.github.io/Omni-Edu/.

Acesso em: 2026.

Últimos Artigos

OmniEdu: modelos abertos que unem ensino e aprendizagem em K-12
Realtime-Venus: diálogo full-duplex com delegação assíncrona
RRSI: regularizar a auto-melhoria recursiva de agentes LLM
DeepSeek-V4.1-Flash: compressão radical de KV cache