AWS mostra treino de RL multimodal com SkyRL no HyperPod

AWS mostra treino de RL multimodal com SkyRL no HyperPod

A Amazon Web Services (AWS) publicou em 25 de setembro de 2026 um guia técnico que mostra, na prática, como treinar modelos multimodais com aprendizado por reforço em escala de produção. A proposta combina o SkyRL, framework de RL de código aberto do projeto NovaSky-AI, com o Amazon SageMaker HyperPod, infraestrutura gerenciada sobre o Amazon Elastic Kubernetes Service (Amazon EKS).

No exemplo, o objetivo é pós-treinar o Qwen3-VL-8B, um modelo de visão e linguagem, para resolver labirintos visuais. A taxa de acerto sobe de 43,75% para mais de 95% em um conjunto fixo de 64 labirintos usados na avaliação.

Por que rl multimodal exige infraestrutura persistente

O pós-treino com aprendizado por reforço deixou de ser experimento de laboratório. Virou etapa padrão na construção de agentes de linguagem capazes.

Em vez de aprender com um único par pergunta-resposta, o modelo gera trajetórias completas. Recebe recompensas e atualiza sua política a partir do desfecho de cada episódio.

Rodar isso em escala exige um cluster que aguente jobs longos. São vários nós e centenas de horas de GPU dedicadas apenas à geração de trajetórias.

É aí que entra o Amazon SageMaker HyperPod. Seus recursos de resiliência monitoram a saúde dos nós e substituem automaticamente máquinas com defeito.

O checkpointing permite retomar o treinamento do último passo salvo em vez de recomeçar do zero.

Isso pesa quando uma única falha de hardware poderia custar horas de progresso em uma rodada de RL.

Como o grpo transforma o labirinto em sinal de treino

No cenário escolhido pela AWS, cada episódio é uma tentativa de percorrer um labirinto 2D. O modelo observa a imagem do estado atual, escolhe uma direção ou decide parar.

O ambiente devolve a nova visão.

A recompensa é esparsa: vale 1,0 somente quando o agente alcança o objetivo dentro do limite de movimentos. Não existe gabarito passo a passo, porque a qualidade de uma jogada depende das jogadas ao redor.

O Group Relative Policy Optimization (GRPO) contorna essa limitação. Compara várias execuções do mesmo ponto de partida sob a política vigente e reforça as que ficam acima da média do grupo.

O guia também remete à documentação de multi-turn RL para quem quiser entender o paradigma de treinar agentes ao longo de sequências inteiras de passos.

Do studio ao cluster: o caminho prático

O tutorial começa na construção da imagem de contêiner e termina com o adaptador LoRA hospedado para inferência. O ponto de partida é o checkpoint de SFT do VisGym, um modelo já ajustado por supervisão.

A partir dele, o SkyRL conduz o pós-treino com GRPO.

Na infraestrutura, são necessárias pelo menos três instâncias ml.g7e.12xlarge e uma ml.r5d.16xlarge. Também entram operadores Kubernetes específicos: KubeRay, o add-on de observabilidade do HyperPod e o Ray Endpoint Operator, usado para submissão remota de jobs.

Um sistema de arquivos Amazon FSx for Lustre montado em /shared guarda checkpoints, a sincronização do adaptador LoRA e a saída da avaliação.

Também é preciso um domínio do SageMaker Studio com permissão para se conectar ao cluster e o pacote Python toolkit-for-ray-on-sagemaker-ai instalado. Com isso, o usuário cria um cluster Ray direto do Studio, envia o job por conexão segura e acompanha o treinamento em dashboards prontos do Amazon Managed Grafana, provisionados automaticamente pelo add-on de observabilidade do HyperPod.

O que isso muda para quem treina modelos

A divulgação interessa a times que já enfrentam o gargalo de rodar RL multimodal em produção. O custo não está apenas nas GPUs.

Está na engenharia necessária para manter jobs longos vivos, recuperá-los de falhas e enxergar o que acontece durante o treinamento.

Ao amarrar resiliência, checkpointing, Ray e observabilidade em um único caminho documentado, a AWS reduz o trabalho de integração que hoje consome semanas de equipes de plataforma.

O salto de 43,75% para mais de 95% em um conjunto fixo de 64 labirintos é modesto como benchmark. Mas ilustra o tipo de ganho que recompensas esparsas e comparação dentro de grupo conseguem extrair quando a infraestrutura não atrapalha.

O movimento também sinaliza que o pós-treino com reforço, antes quase restrito a modelos de texto, avança sobre a modalidade visual. Modelos como o Qwen3-VL-8B servem de teste para agentes que precisam enxergar e agir em sequência.

Fontes e links

Matéria publicada originalmente em AWS

Últimas Notícias

Cloudflare quer cobrar bots de IA e redefinir a economia da web
Synthesia cria gêmeo digital de jornalista e testa avatar interativo
Simon Willison registra três espécies de aves na Califórnia
Datacor usa Amazon Quick Sight para analytics de aluguéis