AWS aposta em agentes e leva modelos da OpenAI ao Bedrock

AWS aposta em agentes e leva modelos da OpenAI ao Bedrock

Em setembro de 2026, a AWS concentrou uma rodada de lançamentos para quem desenvolve aplicações de inteligência artificial em três frentes: Amazon Bedrock, Amazon Bedrock AgentCore e o kit de código aberto Strands. O balanço, publicado no blog de machine learning da empresa, indica uma mudança de ênfase: com modelos cada vez mais capazes e um catálogo em expansão, o desempenho bruto deixou de ser a única pergunta relevante.

Clientes passaram a comparar custo e benefício para cada caso de uso, e essa conta pesa na hora de delegar tarefas a agentes em produção.

Modelos da OpenAI ampliam o catálogo do bedrock

Na camada de modelos, os modelos Astra, Sol e Luna, da OpenAI, passaram a estar geralmente disponíveis no Amazon Bedrock. O GPT-6 Astra é apresentado como o modelo de ponta para trabalhos mais ambiciosos, com raciocínio mais profundo em decisões complexas, análise de documentos e desenvolvimento de software, além de suportar até 1 milhão de tokens de entrada.

A AWS afirma que ele opera sobre arquivos e software e entrega saída com qualidade profissional alinhada à voz, aos modelos e aos padrões de cada organização. Já o GPT-6 Astra Ultrafast adiciona uma faixa premium de velocidade, com inferência até 6 vezes mais rápida na API e até 300 tokens por segundo.

Sol aproxima a inteligência do Astra de tarefas de codificação, e a oferta cobre desde projetos exigentes e trabalho recorrente complexo até tarefas de alto volume.

Agentes gerenciados e um runtime mais enxuto

Para agentes, o Amazon Bedrock Managed Agents, com tecnologia da OpenAI, entrou em prévia pública. A proposta é permitir a construção de agentes prontos para produção sem abrir mão de segurança corporativa: os modelos rodam com os dados mantidos dentro da AWS, as permissões existentes do AWS Identity and Access Management (IAM) podem ser reaproveitadas e a auditabilidade é mantida pelo AWS CloudTrail.

Sessões duráveis e fluxos de aprovação humana embutidos reduzem o esforço de desenvolvimento e o risco, segundo a empresa.

No AgentCore, o novo runtime traz gerenciamento de memória mais eficiente e menor latência de cold start para agentes serverless. Na prática, o cliente paga pelo uso efetivo, e não pelo pico de memória, com preço pay-as-you-go e sem provisionar capacidade de antemão.

As sessões escalam para zero quando ficam ociosas e rodam em ambientes isolados por hardware.

Strands: menos tokens e decisões locais

Entre as ferramentas abertas, o Strands harness é descrito como um novo harness de agentes que acompanha harnesses populares em precisão usando 28% menos tokens. Com ele, é possível criar um agente pronto para produção em uma única linha de Python ou TypeScript, com gerenciamento de contexto, cache de prompts e memória já embutidos, e implantá-lo onde for necessário.

O Strands Decider 2B, por sua vez, é um modelo de decisão aberto de 2 bilhões de parâmetros que escolhe entre opções predefinidas em vez de gerar texto, com respostas em cerca de 115 milissegundos rodando localmente. Ele foi otimizado para tarefas agênticas como seleção de ferramentas, roteamento e guardrails, com código, dados e pesos disponíveis no GitHub e no Hugging Face.

Por que isso importa

O conjunto de anúncios aponta para uma disputa que saiu do modelo isolado e migrou para o sistema em volta dele: o contexto que o agente acessa, as ações que consegue executar e a forma como os dados corporativos são governados e protegidos. À medida que agentes assumem tarefas de longo prazo em fluxos de trabalho reais, segurança, precisão e governança deixam de ser detalhes de implementação e passam a definir a viabilidade econômica do projeto. Ao mesmo tempo, eficiência vira diferencial competitivo: um harness que consome 28% menos tokens ou um runtime que cobra pelo uso real alteram diretamente a conta no fim do mês, enquanto um modelo decisor pequeno e local pode baratear etapas de roteamento que hoje dependem de chamadas a modelos grandes.

Fontes e links

Matéria publicada originalmente em Anthropic

Últimas Notícias

DistroKid tira músicas do ar após processo da UMG sobre IA
Apple contrata equipe da Huxe e licencia tecnologia de podcasts
Agentes de IA que vivem no seu SMS: a nova disputa do setor
Agentes da Anthropic enviam 20 pedidos de visto a site dos EUA