A EverMind AI apresenta no paper "Raven: The Harness of Harnesses for Composable Agentic Intelligence" um ecossistema multiagente de código aberto. Nele, cada par executável modelo–harness é tratado como uma unidade composável de inteligência.
A tese central dos autores é outra. Em vez de projetar à mão um harness cada vez mais forte para um único domínio, vale mais construir harnesses especializados de forma automática, melhorá-los com experiência acumulada e orquestrá-los entre domínios.
Para sustentar isso, o trabalho combina três peças. Uma arquitetura de orquestração, uma teoria formal de composição sob orçamento de recursos e um novo benchmark, o MAOB.
O que os autores propõem
Os autores descrevem o Raven como "o harness de harnesses". O ecossistema reúne especialistas nativos, como Raven-Research, Raven-Code, Raven-Design e Raven-Oncall, e agentes de terceiros, como Claude Code, Codex, Hermes Agent e OpenClaw.
Adaptadores de execução conectam esses agentes a uma interface comum de orquestração. Eles preservam ferramentas e políticas internas.
Um registro de agentes descreve as capacidades ao Host Agent.
A contribuição é declarada em três frentes. A primeira é uma arquitetura aberta para composição de harnesses, com evolução modular, memória persistente e reúso de skills.
A segunda é uma teoria da "inteligência agêntica composável". Ela formaliza capacidades relativas à tarefa e condições suficientes para composição confiável e cobertura ampliada sob um mesmo orçamento de recursos.
A terceira é o Multi-Agent Orchestration Benchmark (MAOB). O benchmark mede seleção de especialistas e predição de dependências, com avaliações por domínio, de adaptação de harness e de reúso de skills.
O paper é um preprint na arXiv (2609.33439), datado de 27 de setembro de 2026, sem venue informado. A página do projeto é raven.evermind.ai.
Contexto: qual problema está sendo atacado
O ponto de partida é o deslocamento dos agentes de LLM. Eles saem de tarefas isoladas e específicas de domínio para fluxos de trabalho de longo horizonte e entre domínios.
Segundo os autores, essa transição expõe dois problemas ao mesmo tempo. A complexidade crescente do harness torna o desenho manual difícil de escalar.
E o acoplamento estreito a um domínio limita a generalidade de um único harness.
A pergunta central muda. Deixa de ser como engenheirar um harness mais forte para um domínio.
Passa a ser como construir autonomamente harnesses especializados, aprimorá-los pela experiência e orquestrá-los entre domínios.
O exemplo usado pelos autores é o desenvolvimento e a operação de um jogo de tiro em primeira pessoa. Ele envolve pesquisa de requisitos, programação de gameplay, design visual, testes de integração e operação contínua.
Cada etapa tem ferramentas e critérios de conclusão distintos, e as saídas precisam alimentar a etapa seguinte.
Nessa formulação, a capacidade prática de um agente depende tanto do modelo quanto do harness. Isso inclui interfaces de ferramentas, gestão de contexto, skills, políticas de execução e mecanismos de recuperação.
Os autores citam análises de falhas em sistemas multiagente. Elas apontam desalinhamento entre agentes e verificação inadequada de tarefas como problemas recorrentes.
O benefício de uma composição depende da estrutura da tarefa, das capacidades locais e do custo de coordenação.
Como funciona
O núcleo do Raven é o Host Agent. Ele decompõe objetivos, casa subtarefas com capacidades registradas e representa dependências como um grafo acíclico dirigido (DAG).
Cada nó invoca um agente, e as arestas identificam dependências entre saídas e trabalho subsequente.
O runtime verifica o plano antes do despacho, agenda nós prontos, registra artefatos para handoff e reúso, trata exceções de execução e integra os entregáveis.
Formalmente, os autores definem um plano como um grafo executável com obrigações semânticas e de recursos. Ele tem conjunto finito de nós de chamada a workers, arestas de handoff, atribuição de executor, anotações de contratos e invariantes, e uma escala de execução.
Artefatos ficam em um ledger append-only, separado do estado mutável. Apenas o pacote autorizado e as mensagens declaradas se tornam entradas dos workers.
Sobre essa base operam três mecanismos. O primeiro é a evolução de harness.
Harnesses modulares expõem políticas de execução que um evolver externo pode modificar dentro de limites definidos. O processo diagnostica falhas, propõe harnesses candidatos e avalia seu comportamento com um modelo de tarefa congelado.
Os autores ligam essa linha ao seu trabalho anterior, o HarnessBank.
O segundo é a memória. Um arquivo do host retém contexto do usuário.
O backend opcional EverOS oferece acesso semântico à experiência passada.
O terceiro é o Skill Forge. Ele recupera procedimentos relevantes de skills locais, de skills derivadas da memória e do SkillHub.
O corpus e o desenho de recuperação se baseiam no SkillCorpus.
A parte teórica define capacidade como cobertura confiável de tarefas sob um orçamento comum. O custo é aditivo e cobre cada operação uma vez: inferência, ferramentas, planejamento, workers, handoffs, verificação em runtime e retentativas.
Não terminação conta como insucesso, mesmo com custo monetário finito. A correção objetiva é distinta de um agente ou juiz declarar conclusão.
Os autores estabelecem condições suficientes sob as quais complementaridade local, handoffs compatíveis e erros de planejamento e execução limitados permitem ao sistema composto resolver tarefas que os agentes individuais disponíveis não resolvem de forma confiável sob o mesmo orçamento.
Resultados reportados
Os autores organizam a evidência empírica em quatro blocos. São eles orquestração, os quatro especialistas nativos, adaptação de harness e reúso de skills.
Para o primeiro, introduzem o MAOB. Ele mede seleção de especialistas e predição de dependências comparando os DAGs propostos com grafos de referência, antes da execução dos workers.
Segundo o paper, o Raven fica em primeiro lugar entre os sistemas comparados nas quatro métricas de grafo, sob dois backbones testados. Há ganhos de Exact Match sobre o baseline mais forte.
O extrato de texto disponível não traz os valores numéricos desses ganhos, truncados no material analisado, e por isso não são reproduzidos aqui.
Para os especialistas, há avaliações específicas de domínio dos quatro agentes nativos. Para adaptação, os experimentos publicados do HarnessBank avaliam o método de evolução com backbone congelado.
Para reúso de skills, os experimentos publicados do SkillCorpus indicam que uma biblioteca curada de skills melhora o Raven em três benchmarks, com ganhos maiores que o OpenClaw em dois deles. Em tarefas complexas e de longo horizonte, os autores afirmam que o Raven supera o estado da arte em sistemas agênticos.
Limitações e o que não foi provado
A primeira ressalva é dos próprios autores. A teoria estabelece condições suficientes, não necessárias, e sua aplicabilidade prática depende de os agentes e o host implementados de fato satisfazerem essas condições.
Trata-se de um resultado sobre um pool de agentes e uma família de tarefas especificados, não de uma garantia geral de superioridade.
O texto também reconhece limites de escopo. Conclusões empíricas valem para os sistemas avaliados.
Resultados como os do AgentBench, citados no paper, mostram deficiências de raciocínio de longo prazo, tomada de decisão e seguimento de instruções em sistemas avaliados. Isso reforça a necessidade de perfilamento de capacidade nas distribuições de tarefa pretendidas.
Os autores observam ainda que comparar a composição com execuções completas de um único agente é um passo separado. Limitações individuais não implicam, por si só, complementaridade.
Há também limites metodológicos visíveis no material. O MAOB avalia o plano antes da execução dos workers, ou seja, mede a qualidade da orquestração e não o resultado final do trabalho executado.
Os ganhos numéricos de Exact Match não constam do extrato analisado.
O trabalho é um preprint sem venue informado, o que significa que não passou por revisão por pares até o momento do acesso. A análise aqui apresentada se baseia no abstract, na introdução e nas seções iniciais de método e teoria disponibilizadas, não no paper completo.
Por que isso importa para quem constrói com IA
Para equipes que colocam agentes em produção, o argumento central é que o harness, e não o prompt, é o artefato de engenharia que determina o que um agente consegue fazer. Ao tratar o par modelo–harness como unidade de composição, o Raven desloca a pergunta de "qual modelo usar" para "como decompor o objetivo, casar subtarefas com executores e garantir handoffs compatíveis".
A proposta de medir orquestração separadamente da execução é útil na prática. Permite diagnosticar se um fracasso veio do plano, da seleção de especialista ou do worker.
Memória persistente e bibliotecas de skills curadas aparecem como ativos reutilizáveis. A inclusão explícita do custo de coordenação no orçamento evita a ilusão de que compor agentes é gratuito.
Para times que já operam múltiplos agentes de fornecedores diferentes, a ideia de adaptadores sobre uma interface comum é um caminho concreto de integração.
O paper está disponível em arXiv.org/abs/2609.33439 e a página do projeto é raven.evermind.ai.
Referências
- EverMind AI. Raven: The Harness of Harnesses for Composable Agentic Intelligence. arXiv:2609.33439, 2026. Disponível em https://arxiv.org/abs/2609.33439
- Página oficial do projeto Raven: https://raven.evermind.ai/
- Trabalhos citados pelos autores como base do sistema: HarnessBank, SkillCorpus, EverOS, SkillHub e o benchmark MAOB (Multi-Agent Orchestration Benchmark), sem URLs informadas no material de origem.




