A Amazon Web Services (AWS) publicou em 25 de setembro de 2026 um guia técnico que mostra, na prática, como treinar modelos multimodais com aprendizado por reforço em escala de produção. A proposta combina o SkyRL, framework de RL de código aberto do projeto NovaSky-AI, com o Amazon SageMaker HyperPod, infraestrutura gerenciada sobre o Amazon Elastic Kubernetes Service (Amazon EKS).
No exemplo, o objetivo é pós-treinar o Qwen3-VL-8B, um modelo de visão e linguagem, para resolver labirintos visuais. A taxa de acerto sobe de 43,75% para mais de 95% em um conjunto fixo de 64 labirintos usados na avaliação.
Por que rl multimodal exige infraestrutura persistente
O pós-treino com aprendizado por reforço deixou de ser experimento de laboratório. Virou etapa padrão na construção de agentes de linguagem capazes.
Em vez de aprender com um único par pergunta-resposta, o modelo gera trajetórias completas. Recebe recompensas e atualiza sua política a partir do desfecho de cada episódio.
Rodar isso em escala exige um cluster que aguente jobs longos. São vários nós e centenas de horas de GPU dedicadas apenas à geração de trajetórias.
É aí que entra o Amazon SageMaker HyperPod. Seus recursos de resiliência monitoram a saúde dos nós e substituem automaticamente máquinas com defeito.
O checkpointing permite retomar o treinamento do último passo salvo em vez de recomeçar do zero.
Isso pesa quando uma única falha de hardware poderia custar horas de progresso em uma rodada de RL.
Como o grpo transforma o labirinto em sinal de treino
No cenário escolhido pela AWS, cada episódio é uma tentativa de percorrer um labirinto 2D. O modelo observa a imagem do estado atual, escolhe uma direção ou decide parar.
O ambiente devolve a nova visão.
A recompensa é esparsa: vale 1,0 somente quando o agente alcança o objetivo dentro do limite de movimentos. Não existe gabarito passo a passo, porque a qualidade de uma jogada depende das jogadas ao redor.
O Group Relative Policy Optimization (GRPO) contorna essa limitação. Compara várias execuções do mesmo ponto de partida sob a política vigente e reforça as que ficam acima da média do grupo.
O guia também remete à documentação de multi-turn RL para quem quiser entender o paradigma de treinar agentes ao longo de sequências inteiras de passos.
Do studio ao cluster: o caminho prático
O tutorial começa na construção da imagem de contêiner e termina com o adaptador LoRA hospedado para inferência. O ponto de partida é o checkpoint de SFT do VisGym, um modelo já ajustado por supervisão.
A partir dele, o SkyRL conduz o pós-treino com GRPO.
Na infraestrutura, são necessárias pelo menos três instâncias ml.g7e.12xlarge e uma ml.r5d.16xlarge. Também entram operadores Kubernetes específicos: KubeRay, o add-on de observabilidade do HyperPod e o Ray Endpoint Operator, usado para submissão remota de jobs.
Um sistema de arquivos Amazon FSx for Lustre montado em /shared guarda checkpoints, a sincronização do adaptador LoRA e a saída da avaliação.
Também é preciso um domínio do SageMaker Studio com permissão para se conectar ao cluster e o pacote Python toolkit-for-ray-on-sagemaker-ai instalado. Com isso, o usuário cria um cluster Ray direto do Studio, envia o job por conexão segura e acompanha o treinamento em dashboards prontos do Amazon Managed Grafana, provisionados automaticamente pelo add-on de observabilidade do HyperPod.
O que isso muda para quem treina modelos
A divulgação interessa a times que já enfrentam o gargalo de rodar RL multimodal em produção. O custo não está apenas nas GPUs.
Está na engenharia necessária para manter jobs longos vivos, recuperá-los de falhas e enxergar o que acontece durante o treinamento.
Ao amarrar resiliência, checkpointing, Ray e observabilidade em um único caminho documentado, a AWS reduz o trabalho de integração que hoje consome semanas de equipes de plataforma.
O salto de 43,75% para mais de 95% em um conjunto fixo de 64 labirintos é modesto como benchmark. Mas ilustra o tipo de ganho que recompensas esparsas e comparação dentro de grupo conseguem extrair quando a infraestrutura não atrapalha.
O movimento também sinaliza que o pós-treino com reforço, antes quase restrito a modelos de texto, avança sobre a modalidade visual. Modelos como o Qwen3-VL-8B servem de teste para agentes que precisam enxergar e agir em sequência.







