Postman leva Agent Mode a 40 milhões de devs no Bedrock

Postman leva Agent Mode a 40 milhões de devs no Bedrock

Postman e Amazon Web Services (AWS) detalharam, em 9 de outubro de 2026, como o Agent Mode do Postman é executado sobre o Amazon Bedrock para atender uma base de 40 milhões de desenvolvedores. O relato foi publicado no blog de machine learning da AWS e parte de uma constatação que costuma ser subestimada: fazer um agente de IA funcionar em uma demonstração é um problema bastante diferente de operá-lo em produção, sob demanda real e concorrência por recursos. (How Postman runs Agent Mode for 40 million developers on Amazon Bedrock)

Do protótipo à operação contínua

A diferença central não está apenas no modelo, e sim no que acontece ao redor dele. Em uma demo, o agente responde a um punhado de instruções previsíveis.

Em escala, ele precisa lidar com milhões de usuários, cada um com seu próprio conjunto de tarefas, e com um ambiente técnico que muda o tempo todo. Segundo o material divulgado, a equipe por trás do Agent Mode organizou esse desafio em torno de três frentes: controlar a proliferação de ferramentas, expor leituras baseadas em esquema e tratar o contexto como o verdadeiro gargalo do sistema.

Controlando a proliferação de ferramentas

Agentes de IA ganham capacidade ao acessar ferramentas externas, como APIs, consultas e serviços internos. O problema é que essa coleção tende a crescer sem controle.

Cada nova ferramenta adiciona opções de ação, aumenta a ambiguidade na escolha do próximo passo e amplia o espaço de erro. Em produtos de grande porte, esse acúmulo deixa de ser um detalhe de implementação e passa a afetar diretamente a confiabilidade do que chega ao usuário.

O padrão descrito por Postman e AWS passa justamente por disciplinar esse conjunto: manter o inventário de ferramentas gerenciável, em vez de simplesmente empilhar integrações conforme elas surgem, é o que evita que o agente se perca entre possibilidades concorrentes.

Leituras baseadas em esquema

Outro ponto destacado é a adoção de leituras baseadas em esquema, ou seja, formatos estruturados e previsíveis para aquilo que o agente lê e recebe de volta. Esquemas reduzem a dependência de interpretação livre por parte do modelo e tornam o comportamento mais verificável.

Para quem opera sistemas em larga escala, isso significa menos variação inesperada, depuração mais simples e maior capacidade de validar respostas antes que elas cheguem ao usuário final. Em vez de confiar que o modelo vai acertar o formato, a arquitetura impõe o formato.

O contexto como gargalo real

O terceiro eixo é o mais contraintuitivo: tratar o contexto como o recurso realmente escasso. A questão não é apenas quanto cabe na janela de contexto, mas o que deve entrar nela a cada etapa.

Em um agente com muitas ferramentas e muitas interações, carregar tudo o que existe é inviável e contraproducente. Selecionar apenas o que é relevante para o passo atual deixa de ser um ajuste fino de última hora e se torna uma decisão de arquitetura, com impacto direto em custo, latência e qualidade das respostas.

Bedrock como base de execução

Toda essa engenharia roda sobre o Amazon Bedrock, o serviço da AWS que dá acesso a modelos de fundação por meio de API. O relato trata explicitamente de como o Agent Mode opera nessa base em escala, o que conecta o desenho do agente a decisões de infraestrutura: latência, custo por chamada, limites de requisição e disponibilidade deixam de ser assuntos separados do produto.

É a diferença entre um protótipo que funciona na máquina do desenvolvedor e um serviço que precisa responder a 40 milhões de pessoas. (How Postman runs Agent Mode for 40 million developers on Amazon Bedrock)

Por que isso importa

Casos como esse ajudam a deslocar o debate sobre agentes de IA do terreno das capacidades dos modelos para o terreno da engenharia de sistemas. Perguntas como quais ferramentas expor, em que formato devolver dados e o que manter no contexto são decisões que definem se um agente sobrevive ao uso real.

Para equipes que desenvolvem no Brasil e no exterior, a lição prática é que a agenda migrou: o prompt importa, mas a arquitetura em volta dele importa mais quando o volume cresce. O fato de a operação estar apoiada em um serviço gerenciado de nuvem também indica que a escalabilidade do agente depende tanto do código quanto da infraestrutura escolhida para sustentá-lo.

O texto original não detalha modelos específicos nem métricas internas de desempenho, concentrando-se nos padrões de arquitetura adotados. Ainda assim, o recorte é relevante por vir de uma empresa que atende uma base de dezenas de milhões de desenvolvedores, o que dá peso prático às escolhas descritas.

Fontes e links

Matéria publicada originalmente em AWS

Últimas Notícias

DistroKid tira músicas do ar após processo da UMG sobre IA
Apple contrata equipe da Huxe e licencia tecnologia de podcasts
Agentes de IA que vivem no seu SMS: a nova disputa do setor
Agentes da Anthropic enviam 20 pedidos de visto a site dos EUA