SageMaker Inference: AWS soma 13 lançamentos em 2026

SageMaker Inference: AWS soma 13 lançamentos em 2026

A Amazon Web Services (AWS) publicou em 18 de setembro de 2026 um balanço das novidades de inferência do Amazon SageMaker AI no acumulado do ano: 13 lançamentos distribuídos em dois caminhos de implantação, endpoints totalmente gerenciados e Amazon SageMaker HyperPod Inference. O texto, divulgado no blog de machine learning da AWS, percorre cada uma das capacidades e explica para quais equipes elas foram criadas, de startups a empresas e órgãos públicos.

Dois caminhos, um mesmo objetivo

O post abre descrevendo por que inferência de IA generativa é um problema difícil. Modelos ocupam de dezenas a centenas de gigabytes.

A latência é medida em tokens por segundo.

Partidas a frio podem levar vários minutos enquanto contêineres e pesos são transferidos. A capacidade de GPU é restrita.

Ferramentas tradicionais de monitoramento não expõem os sinais em nível de token que importam em produção.

O SageMaker AI oferece consumir modelos por instância, e não por token, por dois caminhos distintos.

Nos endpoints gerenciados, a AWS responde pelo provisionamento de GPU, pelo escalonamento e pelo monitoramento operacional. A equipe traz o modelo e define a Meta de desempenho.

A implantação acontece por console, SDK ou CLI. O protocolo de API é compatível com OpenAI.

O escalonamento usa auto scaling gerenciado com Amazon CloudWatch.

Nessa trilha foram sete lançamentos: recomendações de inferência, capacidade ciente de instâncias, API OpenAI, cache de contêiner, observabilidade, payloads inline na inferência assíncrona e roteamento ciente de prefixo.

Já o HyperPod Inference atende quem precisa de controle nativo de Kubernetes sobre clusters dedicados de GPU. O deploy passa por kubectl, Terraform, console, CLI e SDK.

O escalonamento combina Karpenter, KEDA e CloudWatch.

Há maior possibilidade de customização, com acesso em nível de nó, escolha de frameworks e de AMI. O protocolo aceita HTTP, gRPC e balanceador de carga customizado.

É o caminho indicado para operações de treino até serviço e implantações multinuvem ou híbridas, com seis lançamentos: operador simplificado, cache KV em camadas, captura de dados, recursos de desempenho, prefill e decode desagregados e cache de modelo.

Recomendações de inferência encurtam o caminho até produção

O primeiro destaque de 2026, de abril, é o recurso de recomendações de inferência com benchmark automatizado. Segundo a AWS, escolher tipo de instância, contêiner de serving e ajustes de otimização costuma exigir de duas a três semanas de benchmarking manual sobre mais de mil combinações.

É um nível de especialização que a maioria das equipes não tem internamente.

No novo fluxo, o cliente informa o modelo e a Meta, que pode ser custo, latência ou vazão.

A partir daí o serviço executa três etapas. Primeiro restringe o espaço de tipos de instância analisando arquitetura, tamanho e requisitos de memória do modelo.

Depois aplica técnicas alinhadas à Meta escolhida, como decodificação especulativa EAGLE 3.0 para vazão, ajuste de kernels para latência e paralelismo de tensores conforme o tamanho do modelo. Roda o NVIDIA AIPerf em infraestrutura real de GPU, com relatórios de confiança baseados em múltiplas execuções.

O resultado é um SageMaker Model Package com configurações prontas para implantação e métricas validadas, incluindo tempo até o primeiro token (TTFT), latência entre tokens (ITL), percentis P50, P90 e P99, vazão e projeção de custo.

Em um exemplo demonstrado, a otimização de vazão no modelo GPT-OSS-20B entregou o dobro de tokens por segundo mantendo a mesma latência de requisição. Gerar recomendações não tem custo adicional.

Clientes com ML Reservations podem fazer os testes na capacidade reservada sem cobrança extra, e o recurso também serve para comparar instâncias alternativas.

Capacidade e técnicas de cache

Em maio de 2026, a AWS anunciou os pools de instâncias cientes de capacidade, parte do esforço para lidar com a oferta limitada de GPU em inferência de modelos generativos.

Na trilha HyperPod, o ano trouxe ainda o cache KV em camadas e a separação entre prefill e decode, que divide as etapas de processamento do prompt e de geração de tokens, além de captura de dados, cache de modelo, operador simplificado e recursos de desempenho.

Por que isso importa

O balanço deixa claro que a AWS aposta em duas estratégias complementares em vez de uma única plataforma de inferência. Quem quer velocidade de entrada em produção com o mínimo de operação fica nos endpoints gerenciados.

Times com requisitos de controle, portabilidade ou integração com Kubernetes escolhem o HyperPod.

Para o mercado brasileiro, que acompanha a corrida por inferência de modelos abertos e proprietários, a leitura prática é que automação de benchmark, gestão de capacidade e caching deixaram de ser diferenciais. Passaram a compor o conjunto básico de ferramentas de quem coloca IA generativa em produção.

Fontes e links

Matéria publicada originalmente em AWS

Últimas Notícias

Anthropic e Accenture criam avaliação embarcada para IA de fronteira
OpenAI e Microsoft sabiam de 'doom loop' na web, diz processo
SageMaker Inference: AWS soma 13 lançamentos em 2026
Índia obriga apps de caller-ID a enviar denúncias de spam a operadoras