Postman e Amazon Web Services (AWS) detalharam, em 9 de outubro de 2026, como o Agent Mode do Postman é executado sobre o Amazon Bedrock para atender uma base de 40 milhões de desenvolvedores. O relato foi publicado no blog de machine learning da AWS e parte de uma constatação que costuma ser subestimada: fazer um agente de IA funcionar em uma demonstração é um problema bastante diferente de operá-lo em produção, sob demanda real e concorrência por recursos. (How Postman runs Agent Mode for 40 million developers on Amazon Bedrock)
Do protótipo à operação contínua
A diferença central não está apenas no modelo, e sim no que acontece ao redor dele. Em uma demo, o agente responde a um punhado de instruções previsíveis.
Em escala, ele precisa lidar com milhões de usuários, cada um com seu próprio conjunto de tarefas, e com um ambiente técnico que muda o tempo todo. Segundo o material divulgado, a equipe por trás do Agent Mode organizou esse desafio em torno de três frentes: controlar a proliferação de ferramentas, expor leituras baseadas em esquema e tratar o contexto como o verdadeiro gargalo do sistema.
Controlando a proliferação de ferramentas
Agentes de IA ganham capacidade ao acessar ferramentas externas, como APIs, consultas e serviços internos. O problema é que essa coleção tende a crescer sem controle.
Cada nova ferramenta adiciona opções de ação, aumenta a ambiguidade na escolha do próximo passo e amplia o espaço de erro. Em produtos de grande porte, esse acúmulo deixa de ser um detalhe de implementação e passa a afetar diretamente a confiabilidade do que chega ao usuário.
O padrão descrito por Postman e AWS passa justamente por disciplinar esse conjunto: manter o inventário de ferramentas gerenciável, em vez de simplesmente empilhar integrações conforme elas surgem, é o que evita que o agente se perca entre possibilidades concorrentes.
Leituras baseadas em esquema
Outro ponto destacado é a adoção de leituras baseadas em esquema, ou seja, formatos estruturados e previsíveis para aquilo que o agente lê e recebe de volta. Esquemas reduzem a dependência de interpretação livre por parte do modelo e tornam o comportamento mais verificável.
Para quem opera sistemas em larga escala, isso significa menos variação inesperada, depuração mais simples e maior capacidade de validar respostas antes que elas cheguem ao usuário final. Em vez de confiar que o modelo vai acertar o formato, a arquitetura impõe o formato.
O contexto como gargalo real
O terceiro eixo é o mais contraintuitivo: tratar o contexto como o recurso realmente escasso. A questão não é apenas quanto cabe na janela de contexto, mas o que deve entrar nela a cada etapa.
Em um agente com muitas ferramentas e muitas interações, carregar tudo o que existe é inviável e contraproducente. Selecionar apenas o que é relevante para o passo atual deixa de ser um ajuste fino de última hora e se torna uma decisão de arquitetura, com impacto direto em custo, latência e qualidade das respostas.
Bedrock como base de execução
Toda essa engenharia roda sobre o Amazon Bedrock, o serviço da AWS que dá acesso a modelos de fundação por meio de API. O relato trata explicitamente de como o Agent Mode opera nessa base em escala, o que conecta o desenho do agente a decisões de infraestrutura: latência, custo por chamada, limites de requisição e disponibilidade deixam de ser assuntos separados do produto.
É a diferença entre um protótipo que funciona na máquina do desenvolvedor e um serviço que precisa responder a 40 milhões de pessoas. (How Postman runs Agent Mode for 40 million developers on Amazon Bedrock)
Por que isso importa
Casos como esse ajudam a deslocar o debate sobre agentes de IA do terreno das capacidades dos modelos para o terreno da engenharia de sistemas. Perguntas como quais ferramentas expor, em que formato devolver dados e o que manter no contexto são decisões que definem se um agente sobrevive ao uso real.
Para equipes que desenvolvem no Brasil e no exterior, a lição prática é que a agenda migrou: o prompt importa, mas a arquitetura em volta dele importa mais quando o volume cresce. O fato de a operação estar apoiada em um serviço gerenciado de nuvem também indica que a escalabilidade do agente depende tanto do código quanto da infraestrutura escolhida para sustentá-lo.
O texto original não detalha modelos específicos nem métricas internas de desempenho, concentrando-se nos padrões de arquitetura adotados. Ainda assim, o recorte é relevante por vir de uma empresa que atende uma base de dezenas de milhões de desenvolvedores, o que dá peso prático às escolhas descritas.







