Grok 4.6 da xAI chega ao Amazon Bedrock com 500 mil tokens

Grok 4.6 da xAI chega ao Amazon Bedrock com 500 mil tokens

A Amazon Web Services anunciou em 21 de setembro de 2026 que o Grok 4.6, modelo da xAI, está disponível no Amazon Bedrock. A chegada amplia o catálogo da plataforma de nuvem com um modelo de fronteira voltado a agentes de longa duração, programação e trabalho de conhecimento.

Segundo a AWS, o modelo foi lançado no Bedrock em 18 de agosto de 2026 e é o segundo da xAI a integrar o serviço, depois do Grok 4.3.

Uma nova superfície de integração

O Grok 4.6 oferece janela de contexto de 500 mil tokens. Permite ajustar o esforço de raciocínio em quatro níveis: low, medium, high e xhigh.

A diferença em relação à geração anterior está menos no modelo em si e mais na forma como ele é exposto. Quando o Grok 4.3 passou a estar geralmente disponível, a xAI entrou no Amazon Bedrock como fornecedora de modelos.

O acesso se dava pelo Bedrock Mantle, o motor de inferência compatível com a interface da OpenAI.

Agora, o Grok 4.6 é servido tanto pelo bedrock-mantle quanto pelo bedrock-runtime. Passa a suportar a Converse API, além de Chat Completions e Responses, e conta com inferência entre regiões (cross-Region inference).

Como o modelo foi treinado

Os detalhes de capacidade e de treinamento vêm do anúncio da própria xAI, o Introducing Grok 4.6. O modelo dá continuidade ao Grok 4.5 com ênfase em agentes que permanecem em uma tarefa por muitas etapas.

Isso vale para pesquisar um tema, analisar informações, percorrer uma base de código ou transformar uma ideia em aplicação ou artefato de trabalho. A empresa relata uma rodada suplementar de treinamento mais longa que a do antecessor.

Essa rodada usou dados curados gerados por modelo para raciocínio e conceitos técnicos avançados, dados de engenharia de alta qualidade e um otimizador e uma receita de treinamento aprimorados.

O Grok 4.5 também foi usado para regenerar as trajetórias de ajuste fino supervisionado em diferentes níveis de esforço de raciocínio, harnesses de agentes e domínios como STEM, engenharia de software e trabalho de conhecimento. Houve filtragem de traços problemáticos por meio de verificações baseadas em modelo.

Na sequência, o treinamento passou por tarefas variadas de aprendizado por reforço agêntico, cobrindo trabalho de conhecimento, programação geral e ambientes específicos como otimização de kernel, desenvolvimento web e desenho assistido por computador.

Autoverificação e segurança

Dois comportamentos apontados pela xAI interessam diretamente a quem constrói agentes. Em trajetórias mais longas, o modelo passou a exibir mais autoteste e verificação, checando o próprio trabalho antes de avançar.

Ele também produz primeiras passadas mais fortes em projetos visuais e interativos, estabelecendo a estrutura e a linguagem visual de uma aplicação em uma única passada. A equipe considerou isso útil quando o caminho mais rápido para um bom resultado é começar com algo substancial e depois iterar.

No campo da segurança, a xAI afirma que as salvaguardas do Grok 4.6 foram aprimoradas e calibradas de acordo com as capacidades do modelo. A empresa descreve sua suíte mais ampla já feita de testes de pré-implantação para capacidades e calibração de salvaguardas, além de testes pós-implantação e de terceiros.

A empresa posiciona sua pilha de segurança como forma de maximizar utilidade e proteção em usos legítimos. Cita áreas como correção de vulnerabilidades, aceleração do ciclo de projeto de engenharia e apoio à pesquisa em IA.

Benchmarks: o que os números medem

A xAI reporta que o Grok 4.6 alcança inteligência de fronteira em vários benchmarks de codificação agêntica e trabalho de conhecimento. Entre os números publicados para a configuração Grok 4.6 High no lançamento, em 12 de agosto de 2026, está o FrontierCode v1.1 (Extended), com 61,3%.

Várias dessas avaliações vêm do Artificial Analysis. Segundo o Artificial Analysis, o Intelligence Index v4.1.1 é um composto que reúne nove avaliações: GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience e AA-LCR.

O conjunto cobre uso agêntico de ferramentas, raciocínio e conhecimento, confiabilidade do conhecimento, raciocínio de contexto longo e análise quantitativa sobre planilhas e documentos. O AA-Briefcase é o benchmark de trabalho de conhecimento agêntico, no qual o Elo agrega taxa de aprovação por rubrica, Elo de qualidade analítica e Elo de apresentação, com notas maiores sendo melhores.

O Artificial Analysis também acompanha custo e latência junto da inteligência. Sua métrica de custo por tarefa é uma média ponderada do custo por tarefa do Intelligence Index, derivada dos preços de tokens de entrada, acerto de cache, escrita de cache, raciocínio e resposta.

Por que isso importa

Para equipes que já operam dentro do Bedrock, o Grok 4.6 reduz o atrito de adoção. O mesmo modelo responde por endpoints distintos e aceita tanto as abstrações nativas do serviço quanto formatos herdados do ecossistema OpenAI.

A combinação de contexto de 500 mil tokens com quatro níveis de esforço de raciocínio permite calibrar custo e profundidade por tipo de tarefa. Isso é relevante em cargas agênticas em que os tokens de raciocínio pesam na fatura.

A leitura de custo por tarefa proposta pelo Artificial Analysis vira um critério prático de dimensionamento. Isso importa quando o objetivo é manter agentes rodando por longos períodos sem estourar o orçamento.

Fontes e links

Matéria publicada originalmente em AWS

Últimas Notícias

NVIDIA apresenta Halos, segurança full-stack para IA física
EXL usa IA na AWS para cortar revisão de sinistros médicos
Benchling isola código de agentes de IA na AWS com DNS Firewall
Disrupt 2026: desconto de até US$ 200 acaba em 25 de setembro