AWS escala RL de MoE no EKS com EFA e DeepEP: 40% mais

AWS escala RL de MoE no EKS com EFA e DeepEP: 40% mais

A Amazon Web Services (AWS) publicou em 25 de setembro de 2026 uma arquitetura de referência para escalar o treinamento por aprendizado por reforço de modelos de Mistura de Especialistas (MoE) no Amazon Elastic Kubernetes Service (Amazon EKS). Segundo a empresa, a combinação de Amazon EKS, Elastic Fabric Adapter (EFA) e DeepEP aumentou em 40% o throughput agregado de rollout em cargas de RLHF e GRPO de grande escala.

Onde o gargalo se desloca

Modelos MoE se tornaram arquitetura padrão para escalar grandes modelos de linguagem a centenas de bilhões ou mesmo trilhões de parâmetros. A esparsidade mantém a inferência eficiente.

Mas ela não elimina a complexidade de infraestrutura no treinamento, observa a AWS.

O pipeline padrão passa por pré-treinamento, mid-training, ajuste supervisionado (SFT) e aprendizado por reforço. É nessa última etapa que as demandas ficam incomuns.

O RL em escala combina trabalho de inferência elástica com treinamento de modelo fortemente acoplado. Esse treinamento exige comunicação de alta largura de banda.

Modelos de recompensa, verificadores e atualizações de checkpoint adicionam pressão extra sobre memória, rede e orquestração.

Comunicação vira o fator limitante

Conforme as arquiteturas MoE mais recentes ficam mais esparsas para reduzir custos de inferência, o treinamento passa a ser limitado mais pela comunicação do que pela computação.

A principal fonte desse overhead é o Paralelismo de Especialistas (Expert Parallelism, EP). Ele introduz roteamento dinâmico de tokens all-to-all entre dispositivos.

A isso se somam os padrões densos e estruturados de Tensor Parallelism (TP), Data Parallelism (DP) e Pipeline Parallelism (PP).

Em cargas de RL assíncronas e fortemente acopladas, essas demandas precisam ser equilibradas com a geração por inferência. Passos de treinamento lentos travam os workers de inferência.

Throughput de inferência insuficiente deixa aceleradores de treinamento ociosos.

Os três desafios listados

A AWS resume o problema em três frentes interligadas. A primeira é equilibrar as demandas concorrentes de geração de rollout e de treinamento de política.

A segunda é gerenciar ao mesmo tempo computação, memória e largura de banda de rede dos aceleradores.

A terceira é lidar com a mudança de comunicação intra-nó de alta largura de banda para enlaces inter-nó de menor largura de banda, conforme os jobs crescem além de uma única instância.

Esse tipo de otimização multi-workload é comum quando treinamento, inferência e avaliação compartilham os mesmos recursos.

EKS, efa e deepep na arquitetura

Na proposta descrita, o Amazon EKS orquestra e acelera o treinamento de RL em larga escala.

O EFA fornece a malha de comunicação entre aceleradores. O material cita a necessidade de sustentar alto throughput em centenas de aceleradores.

O DeepEP otimiza a comunicação de paralelismo de especialistas sobre o EFA.

A arquitetura combina ainda o Amazon S3. O resultado declarado é um ganho de 40% no throughput agregado de rollout de RL.

PPO e grpo: algoritmos diferentes, infraestrutura parecida

O material compara duas abordagens de otimização. O PPO geralmente usa um modelo crítico (critic) para estimar valor durante a otimização de política.

O GRPO dispensa esse modelo separado ao usar recompensas relativas baseadas em grupo.

Apesar das diferenças algorítmicas e de requisitos de modelo, ambos impõem demandas de infraestrutura semelhantes. São elas: geração de rollout em larga escala, treinamento de política fortemente acoplado e comunicação inter-nó de alta largura de banda.

Por que isso importa

A escolha de métricas muda entre as duas fases. Na geração de rollout, o objetivo é maximizar o throughput agregado.

Não se trata de minimizar o tempo até o primeiro token (TTFT) nem a latência entre tokens.

No treinamento de política, os workers avançam em lockstep, como em pré-treinamento ou SFT. Qualquer pico de latência ou worker atrasado pode paralisar o job inteiro ou disparar timeouts da NVIDIA Collective Communications Library (NCCL).

Para quem pós-treina modelos MoE com RLHF ou GRPO, o recado é que engenharia de comunicação e orquestração pesa tanto quanto capacidade de computação. É nesse ponto que a arquitetura apresentada pela AWS concentra seu ganho de 40%.

Fontes e links

  • AWS — matéria original sobre escalabilidade de RL de MoE no Amazon EKS com EFA e DeepEP
Matéria publicada originalmente em AWS

Últimas Notícias

Cloudflare quer cobrar bots de IA e redefinir a economia da web
Synthesia cria gêmeo digital de jornalista e testa avatar interativo
Simon Willison registra três espécies de aves na Califórnia
Datacor usa Amazon Quick Sight para analytics de aluguéis