A Asana conseguiu reduzir em 76 vezes o custo estimado de modelo do seu agente de navegador e deixá-lo 5 vezes mais rápido, segundo um estudo de 144 execuções divulgado pela empresa e repercutido em 9 de outubro de 2026. Na configuração final, apoiada no GPT-6.1 Sol, da OpenAI, cada execução passou a custar em média US$ 0,47 e a levar cerca de quatro minutos, contra um cenário original em produção que rodava sobre o chamado Model B.
O ponto de partida
A Asana atende clientes que automatizam trabalho entre aplicações corporativas por meio da StackAI, plataforma que a companhia adquiriu e que permite montar fluxos capazes de navegar por sites, preencher formulários e coletar informações sem escrever código. Nessa escala, qualquer ineficiência pequena se multiplica.
Foi o que motivou Frank Hidalgo, PhD e CTO da StackAI dentro da Asana, a buscar um agente de navegador mais barato e veloz. Para isso, Hidalgo recorreu ao GPT-6 Astra dentro do Codex e pediu que ele mapeasse a base de código, investigasse o agente, testasse melhorias e comparasse resultados.
O trabalho que, segundo ele, levaria de um a dois meses feito à mão foi concluído em cerca de uma semana.
O que os diagnósticos revelaram
O primeiro achado foi o desperdício de contexto. O agente já fazia cache das instruções fixas e das definições de ferramentas, mas não do histórico crescente de texto e capturas de tela que IA acumulando.
Resultado: a cada requisição, todo esse histórico era reenviado a preço integral. O agente descartava capturas antigas e cortava texto em quase todos os passos.
Como cada edição alterava o histórico, guardá-lo em cache não bastaria, e a perda desses fatos podia obrigar o agente a revisitar páginas já lidas. A partir desse diagnóstico, Hidalgo revisou as correções propostas e escolheu três para teste: estender o cache ao histórico de navegação, aumentar o volume de texto retido e remover capturas em lotes, em vez de a cada passo.
Como os experimentos foram conduzidos
Como o código não havia sido projetado para experimentos controlados, o GPT-6 Astra primeiro o refatorou para que um único frontend e backend sustentassem muitos fluxos em paralelo, cada um com suas próprias configurações. Em seguida conduziu o estudo completo: orçamentos de histórico de 120 mil e 480 mil caracteres e seis políticas de cache e captura de tela, cada combinação testada três vezes em cada um dos quatro modelos.
A política de melhor desempenho permitiu que as capturas se acumulassem até 20 antes de reduzir para a mais recente, mantendo o histórico anterior intacto por trechos mais longos entre descartes. Combinada ao orçamento maior de histórico, ela se tornou o workflow otimizado.
Todas as configurações executavam a mesma tarefa: coletar seis campos de cada um dos 32 livros de um catálogo público de demonstração, representativo do que alguns clientes da Asana rodam na StackAI.
O estudo comparou o GPT-6.1 Sol a três outros modelos de fronteira, identificados apenas como A, B e C. O Model A é um modelo menor e mais barato, de outro laboratório, lançado no outono de 2025, custando metade do GPT-6.1 Sol. O Model B é o modelo originalmente usado em produção, do mesmo laboratório do A, lançado no verão de 2026, com o mesmo preço do GPT-6.1 Sol. O Model C é uma versão atualizada do B, do outono de 2026, também pelo mesmo preço.
Os números finais
Para o Model B, a otimização derrubou o custo estimado de modelo de pelo menos US$ 36,21 por execução para US$ 1,24, uma redução de 29 vezes. O workflow otimizado no GPT-6.1 Sol ficou 2,6 vezes mais barato ainda, a US$ 0,47, e todas as execuções completaram a tarefa com a resposta correta.
Considerando apenas o GPT-6.1 Sol, com o orçamento maior de histórico, as novas políticas de cache e captura cortaram o custo em 4 vezes, de US$ 1,97 para US$ 0,47 por execução. Cada chamada ficou cerca de 3 vezes mais barata, porque 89% da entrada vinha do cache, a 5% do preço não cacheado.
A velocidade também melhorou: pelo menos 22,5 minutos na configuração original sobre o Model B, contra aproximadamente quatro minutos no workflow otimizado.
Todo o trabalho foi registrado no Command, plataforma de entrega de software da Asana, permitindo revisar o estudo inteiro depois. Dali, os achados viraram tickets, depois pull requests, e as mudanças foram para produção.
"Isso teria me tomado de um a dois meses à mão. Com o GPT-6 Astra no Codex, levou cerca de uma semana: eu definia um /goal antes de dormir e revisava os resultados pela manhã", disse Hidalgo.
Para Arnab Bose, CPO da Asana, o episódio mostra "como equipes de humanos e agentes funcionam na prática": um engenheiro definiu a direção, o GPT-6 Astra rodou os experimentos e os resultados foram para produção via Command.
Fontes e links
- Simon Willison
- Estudo da Asana sobre o agente de navegador
- Comunicado sobre a aquisição da StackAI
- StackAI







