Amazon Bedrock: Claude com inferência local em Seul e Singapura

Amazon Bedrock: Claude com inferência local em Seul e Singapura

A Amazon Web Services (AWS) anunciou em 29 de setembro de 2026 que o Amazon Bedrock passou a oferecer modelos da Anthropic com inferência processada dentro da própria região (in-region inference) em Seul e Singapura. Na região Ásia-Pacífico (Seul), identificada pelo código ap-northeast-2, ficam disponíveis o Claude Opus 5 e o Claude Sonnet 5; na Ásia-Pacífico (Singapura), código ap-southeast-1, o Claude Sonnet 5.

O anúncio é dirigido a organizações que precisam manter o processamento de dados dentro de fronteiras específicas. A própria AWS cita serviços financeiros, saúde e setor público como setores com essa exigência.

O que muda na prática

Com a inferência na região, prompts de entrada e respostas geradas permanecem na região escolhida por todo o ciclo de vida da requisição. A AWS afirma que esse processamento não sai da região.

O recurso atende a quem tem exigência de processamento estritamente em uma única região, e não apenas a necessidade de reduzir latência. Para essas empresas, a alternativa deixa de ser rodar modelos em outra geografia ou manter infraestrutura própria.

Passa a ser consumir os modelos da Anthropic em escala a partir do endpoint bedrock-runtime.

Sem camada de roteamento, com cotas regionais

O funcionamento difere dos perfis de inferência entre regiões (cross-Region inference profiles). Não há camada de roteamento: a requisição enviada para Seul ou para Singapura é atendida exclusivamente por aquela região.

Em troca, a vazão fica limitada pela capacidade instalada na região. As requisições estão sujeitas a cotas de serviço por região.

A cobrança segue o preço sob demanda padrão da região chamada. O consumo de cotas, as métricas do Amazon CloudWatch e os registros do AWS CloudTrail também ficam restritos à mesma região.

Isso elimina a distinção entre origem e destino no monitoramento e simplifica a auditoria.

APIs disponíveis e recomendações de uso

A inferência na região está disponível no endpoint bedrock-runtime, recomendado pela AWS para novas aplicações. A chamada é feita com o ID direto do modelo, como Anthropic.claude-opus-5 ou Anthropic.claude-sonnet-5.

O endpoint suporta a Messages API da Anthropic e as APIs InvokeModel e Converse do Amazon Bedrock. Também suporta recursos da plataforma, como o Amazon Bedrock Guardrails e o roteamento inteligente de prompts (intelligent prompt routing).

Como começar pelo console e por código

Para avaliar os modelos sem escrever código ou configurar SDK, o caminho é o playground de texto do console do Amazon Bedrock. Abra o console na região desejada, acesse Test e depois Playground, escolha Select model, busque o modelo, selecione a opção On-Demand em Inference e aplique.

Em seguida, basta inserir um prompt e executar para gerar uma resposta. Para integração programática, a AWS indica a Messages API da Anthropic por meio do SDK da Anthropic, ou a manutenção das APIs Invoke e Converse via AWS Command Line Interface (AWS CLI) e AWS SDKs.

Os pré-requisitos listados são uma conta AWS ativa com acesso ao Amazon Bedrock, AWS CLI instalada e configurada, Boto3 (pip install boto3), o SDK da Anthropic (pip install Anthropic) e o Amazon Bedrock Token Generator para autenticação no serviço.

Por que isso importa

A disponibilidade de modelos de ponta dentro de regiões específicas é um dos pontos que travam projetos de IA generativa em ambientes regulados. Sem ela, times de conformidade costumam vetar o envio de dados sensíveis para fora da jurisdição.

Ao mover a inferência para Seul e Singapura, a AWS amplia o espaço de adoção na Ásia sem exigir mudança na arquitetura de dados das empresas. O trade-off é explícito: ganha-se previsibilidade de residência e de auditoria, mas a capacidade de atendimento passa a depender da região escolhida.

Planejar picos de uso, portanto, exige acompanhar cotas e métricas locais, e não um pool global compartilhado entre datas centers. Para equipes que já operam no Bedrock, a recomendação da AWS é adotar o endpoint bedrock-runtime com o ID direto do modelo.

Isso também vale para quem está começando agora e quer testar os modelos antes de integrá-los à produção.

Fontes e links

Matéria publicada originalmente em AWS

Últimas Notícias

DistroKid tira músicas do ar após processo da UMG sobre IA
Apple contrata equipe da Huxe e licencia tecnologia de podcasts
Agentes de IA que vivem no seu SMS: a nova disputa do setor
Agentes da Anthropic enviam 20 pedidos de visto a site dos EUA