A Amazon Web Services (AWS) publicou em 25 de setembro de 2026 uma arquitetura de referência para escalar o treinamento por aprendizado por reforço de modelos de Mistura de Especialistas (MoE) no Amazon Elastic Kubernetes Service (Amazon EKS). Segundo a empresa, a combinação de Amazon EKS, Elastic Fabric Adapter (EFA) e DeepEP aumentou em 40% o throughput agregado de rollout em cargas de RLHF e GRPO de grande escala.
Onde o gargalo se desloca
Modelos MoE se tornaram arquitetura padrão para escalar grandes modelos de linguagem a centenas de bilhões ou mesmo trilhões de parâmetros. A esparsidade mantém a inferência eficiente.
Mas ela não elimina a complexidade de infraestrutura no treinamento, observa a AWS.
O pipeline padrão passa por pré-treinamento, mid-training, ajuste supervisionado (SFT) e aprendizado por reforço. É nessa última etapa que as demandas ficam incomuns.
O RL em escala combina trabalho de inferência elástica com treinamento de modelo fortemente acoplado. Esse treinamento exige comunicação de alta largura de banda.
Modelos de recompensa, verificadores e atualizações de checkpoint adicionam pressão extra sobre memória, rede e orquestração.
Comunicação vira o fator limitante
Conforme as arquiteturas MoE mais recentes ficam mais esparsas para reduzir custos de inferência, o treinamento passa a ser limitado mais pela comunicação do que pela computação.
A principal fonte desse overhead é o Paralelismo de Especialistas (Expert Parallelism, EP). Ele introduz roteamento dinâmico de tokens all-to-all entre dispositivos.
A isso se somam os padrões densos e estruturados de Tensor Parallelism (TP), Data Parallelism (DP) e Pipeline Parallelism (PP).
Em cargas de RL assíncronas e fortemente acopladas, essas demandas precisam ser equilibradas com a geração por inferência. Passos de treinamento lentos travam os workers de inferência.
Throughput de inferência insuficiente deixa aceleradores de treinamento ociosos.
Os três desafios listados
A AWS resume o problema em três frentes interligadas. A primeira é equilibrar as demandas concorrentes de geração de rollout e de treinamento de política.
A segunda é gerenciar ao mesmo tempo computação, memória e largura de banda de rede dos aceleradores.
A terceira é lidar com a mudança de comunicação intra-nó de alta largura de banda para enlaces inter-nó de menor largura de banda, conforme os jobs crescem além de uma única instância.
Esse tipo de otimização multi-workload é comum quando treinamento, inferência e avaliação compartilham os mesmos recursos.
EKS, efa e deepep na arquitetura
Na proposta descrita, o Amazon EKS orquestra e acelera o treinamento de RL em larga escala.
O EFA fornece a malha de comunicação entre aceleradores. O material cita a necessidade de sustentar alto throughput em centenas de aceleradores.
O DeepEP otimiza a comunicação de paralelismo de especialistas sobre o EFA.
A arquitetura combina ainda o Amazon S3. O resultado declarado é um ganho de 40% no throughput agregado de rollout de RL.
PPO e grpo: algoritmos diferentes, infraestrutura parecida
O material compara duas abordagens de otimização. O PPO geralmente usa um modelo crítico (critic) para estimar valor durante a otimização de política.
O GRPO dispensa esse modelo separado ao usar recompensas relativas baseadas em grupo.
Apesar das diferenças algorítmicas e de requisitos de modelo, ambos impõem demandas de infraestrutura semelhantes. São elas: geração de rollout em larga escala, treinamento de política fortemente acoplado e comunicação inter-nó de alta largura de banda.
Por que isso importa
A escolha de métricas muda entre as duas fases. Na geração de rollout, o objetivo é maximizar o throughput agregado.
Não se trata de minimizar o tempo até o primeiro token (TTFT) nem a latência entre tokens.
No treinamento de política, os workers avançam em lockstep, como em pré-treinamento ou SFT. Qualquer pico de latência ou worker atrasado pode paralisar o job inteiro ou disparar timeouts da NVIDIA Collective Communications Library (NCCL).
Para quem pós-treina modelos MoE com RLHF ou GRPO, o recado é que engenharia de comunicação e orquestração pesa tanto quanto capacidade de computação. É nesse ponto que a arquitetura apresentada pela AWS concentra seu ganho de 40%.
Fontes e links
- AWS — matéria original sobre escalabilidade de RL de MoE no Amazon EKS com EFA e DeepEP







