GLM 5.3 da Z.ai chega ao Amazon Bedrock para código e agentes

GLM 5.3 da Z.ai chega ao Amazon Bedrock para código e agentes

A Z.ai, também identificada como Zhipu AI, passou a oferecer o GLM 5.3 no Amazon Bedrock. O anúncio foi publicado pela AWS em 5 de outubro de 2026 e marca a chegada de mais um modelo de pesos abertos ao catálogo gerenciado da nuvem, desta vez com foco declarado em programação e em tarefas agênticas de longo horizonte.

Segundo a AWS, o acesso é liberado para clientes corporativos elegíveis, sem que a empresa precise administrar infraestrutura de inferência própria.

Um moe de 753 bilhões de parâmetros

O GLM 5.3 é um modelo de mistura de especialistas (mixture-of-experts) com 753 bilhões de parâmetros, conforme as informações publicadas no Hugging Face Hub. Nesse tipo de arquitetura, apenas parte da rede é acionada a cada token, o que ajuda a viabilizar modelos de grande porte em produção.

Antes, segundo a própria AWS, atender demandas como refatorar um repositório com centenas de arquivos, manter fluxos agênticos de várias horas sem perder contexto ou raciocinar sobre problemas complexos de sistemas com uso de ferramentas em cada etapa exigia provisionar e operar infraestrutura de inferência própria. A proposta agora é entregar esse tipo de carga por APIs totalmente gerenciadas.

Código, agentes e segurança cibernética

A Z.ai afirma que o modelo tem desempenho competitivo em benchmarks de programação como DeepSWE, Terminal Bench 3.0 e FrontierSWE. A empresa também relata um ganho de 50% sobre o GLM 5.2 em seu benchmark interno de código.

Comparações diretas com o GLM 5 não foram divulgadas: segundo o material da AWS, a magnitude das melhorias levou à própria atualização dos testes desde o anúncio do GLM 5.1. A linhagem começou a chegar ao Bedrock no início deste ano, com o GLM 5.

Um dos pontos destacados pela AWS é o comportamento em tarefas de segurança. A Z.ai mediu 84,5 pontos no benchmark CyberGym no momento do lançamento, pontuação descrita como líder.

Para a fornecedora de nuvem, esse desempenho torna o modelo um candidato natural a fluxos defensivos de segurança, além de viabilizar testes de penetração autorizados em aplicações próprias, desde que conduzidos dentro de um escopo permitido.

APIs compatíveis com OpenAI, cache e camadas de serviço

O acesso pode ser feito por dois caminhos. No primeiro, pelas APIs Responses e Chat Completions compatíveis com OpenAI; no segundo, pelas APIs Invoke e Converse do Amazon Bedrock.

A AWS informa que o GLM 5.3 suporta cache de prompts implícito, automático, por padrão, e controles explícitos de cache nas APIs compatíveis com OpenAI, esta a opção recomendada. Em cargas agênticas que reenviam grandes prompts de sistema ou trechos de repositório a cada turno, o cache reduz tanto a latência quanto o custo de entrada.

A distribuição usa perfis de inferência entre Regiões: us.zai.glm-5.3, para os Estados Unidos, e global.zai.glm-5.3. O cliente envia a requisição para a Região de origem que escolher e o Bedrock faz o roteamento seguro do processamento, com detalhes no guia de inferência entre Regiões.

Há também três camadas de serviço: Flex, para otimizar custo em cargas menos sensíveis ao tempo; Priority, para priorizar latência em troca de preço maior; e Standard, o equilíbrio padrão entre preço e velocidade. Para os exemplos de código, a AWS lista Python 3.10 ou superior, conta AWS com acesso ao Bedrock e permissões IAM específicas: bedrock:InvokeModel, bedrock:InvokeModelWithResponseStream e bedrock:CallWithBearerToken.

Testes de segurança com o agente strix

Além dos exemplos básicos de chamada, a AWS demonstra um fluxo agêntico realista: executar um teste de segurança autorizado na própria aplicação usando o Strix, agente open-source de testes de penetração com IA. O roteiro exige Docker e a instalação do Strix com o extra bedrock.

Quem preferir começar sem escrever código pode selecionar o modelo no console do Amazon Bedrock, no caminho Test > Playground, e enviar prompts pela interface de chat.

Por que isso importa

Para equipes que já operam no Amazon Bedrock, o GLM 5.3 amplia o leque de modelos com foco em trabalho agêntico e código, sem exigir a montagem de infraestrutura dedicada. O cache de prompts ataca um dos principais gargalos de custo desses fluxos, que é o reenvio constante de contexto extenso.

Já os perfis entre Regiões e as camadas de serviço dão margem para ajustar o equilíbrio entre preço e latência conforme a criticidade da tarefa. A ressalva é o acesso restrito a clientes corporativos elegíveis, o que pode limitar a adoção no curto prazo.

A AWS menciona ainda paridade de recursos entre as APIs compatíveis com OpenAI e os caminhos nativos Invoke e Converse, o que simplifica a migração de aplicações que já seguem o padrão da OpenAI.

Fontes e links

Matéria publicada originalmente em AWS

Últimas Notícias

Anthropic lança CVP ampliado com três níveis de acesso cibernético
Mistral Large 4: modelo de 1 trilhão de parâmetros em preview
Google lança EmbeddingGemma 2, modelo multimodal para dispositivos
Musubi lança PolicyLM-1.7B para moderação em tempo real