当全球AI训练市场深陷NVIDIA GPU供应短缺与生态锁定的双线困局,任何能在非NVIDIA硬件上规模化跑通强化学习的进展都足以引发行业震动。LMSYS Chatbot Arena团队的最新实践正是这样一剂强心针:他们成功将DeepSeek-V4 Flash——一个拥有2840亿参数的MoE(混合专家)模型(每token仅激活130亿参数)——的完整强化学习训练流程,迁移至AMD Instinct MI355X GPU集群上,并公开了端到端验证数据。这并非实验室里的概念验证,而是具备工程可复现性的实战胜果。
此次实验的硬件配置为四个八GPU节点(总计32块MI355X),软件栈基于AMD ROCm生态,并引入了自研的Miles框架作为异步循环与权重同步的核心调度层。在具体分工上:SGLang负责rollout生成(即采样推理)、Megatron承担策略更新(训练阶段)、Miles则协调两者间的异步循环与模型同步。这种分层设计规避了传统同步RL训练中“等待-输出”的低效瓶颈,但同时也引入了三大核心工程挑战:SGLang与Megatron之间的模型权重对齐、动态量化状态下的在线参数更新、以及多节点并行训练的稳定性控制。
针对第一项挑战,团队在每轮rollout前后强制校验SGLang与Megatron中的模型快照哈希值,确保行动策略(policy)与训练策略的一致性。对于量化状态的在线更新,他们将量化尺度因子(scale/offset)纳入模型状态字典,并在每步优化后通过all-gather操作同步到所有rollout节点,而非仅依赖每轮的权重下发。多节点稳定性则通过定制化的梯度压缩与AllReduce超时监控实现,最终在连续超过100个优化器步骤中未出现节点掉线或loss发散。
实验结果提供了扎实的收敛证据:训练-rollout对数概率差在100余步内始终控制在0.1以内,说明SGLang采样的分布与Megatron训练目标之间未出现显著漂移;同时在线奖励函数值保持单调上升趋势,离线AIME-2024基准测试分数也同步增长。虽然绝对性能对比NVIDIA A100/H100仍有差距,但考虑到这是首次在AMD GPU上完成如此规模的RL训练验证,其工程方法论意义远大于单纯的数字比拼。
对行业而言,这一案例释放了两个关键信号:其一,ROCm生态已具备支撑大规模MoE模型强化学习训练的基本能力,三大核心挑战的解决路径均可复现;其二,硬件供应商多元化的窗口已经打开,团队可直接套用Miles+SGLang+Megatron的架构到其他AMD GPU型号甚至其他加速器上。建议计划采用非NVIDIA卡进行RL训练的团队,从单节点验证开始,重点监控量化对齐项,并预留足够的节点间通信超时缓冲区——这一工程红线,比模型架构本身更能决定成败。