当整个AI行业还在为NVIDIA GPU的供货与价格焦虑时,AMD的ROCm生态悄然补上了强化学习训练这一关键缺口。LMSYS(即Chatbot Arena团队)近日公开的一项成果显示,他们已成功将DeepSeek-V4 Flash的强化学习(RL)训练完整迁移至AMD Instinct MI355X GPU上——不是简单的推理或预训练,而是最为棘手的RL训练,并且给出了可复现的实测配置与数据。
DeepSeek-V4 Flash是一个拥有2840亿参数的混合专家(MoE)模型,每个token仅激活130亿参数,兼具规模与效率。将其RL训练搬到AMD平台,团队面临的首要问题是如何让推理引擎、训练框架与调度层在ROCm上协同工作。最终的方案由三部分组成:SGLang负责rollout生成(自回归推理),Megatron负责策略更新(大规模分布式训练),Miles负责异步循环调度与权重同步。这种分层架构借鉴了NVIDIA平台上成熟的RL训练范式,但在AMD硬件上需要逐一适配底层算子与通信协议。
团队在四个八GPU节点(共32块MI355X)上完成了端到端验证。经过超过100个优化器步骤的训练,关键指标均表现健康:训练过程与rollout生成之间的对数概率差(log-prob diff)被控制在可接受范围内,在线奖励曲线持续上升,离线AIME-2024基准分数也同步上涨。这表明AMD平台有能力支撑大规模MoE模型的RL训练,且训练质量不输NVIDIA方案。
回顾整个工程,三个技术挑战最具代表性:模型对齐、量化状态在线更新、多节点并行稳定性。SGLang与Megatron使用不同的参数表示(前者是推理优化后的权重,后者包含优化器状态),团队需要确保两者在每次更新后严格一致,避免策略偏移。同时,RL训练中模型权重不断变化,量化参数(如KV缓存缩放因子)也必须实时同步更新,这要求框架支持动态量化重计算。此外,多节点环境下,如何保证通信不成为瓶颈、不出现死锁,也需要对ROCm的MPI和NCCL-like通信库做精细调参。LMSYS团队将这些问题逐一攻克,并在博客中公开了配置细节,这为后来者提供了宝贵的“避坑指南”。
从行业视角看,这一成果打破了“RL训练 = NVIDIA + CUDA”的固有认知。虽然AMD MI355X在峰值算力和生态成熟度上仍与H100/B200有差距,但在供应链多元化和成本控制的考量下,AMD方案已经具备了实际落地的基础。对正在探索非NVIDIA训练路线的团队而言,这套基于Miles框架的配置值得深入研究——尤其是那些需要将RL训练从实验阶段推向上线的团队,可以重点关注SGLang与Megatron间的权重同步机制,以及量化状态的实时更新策略。
趋势判断上,AMD的ROCm生态正在从“能跑推理”向“能跑完整训练链”迈进。随着MI300X、MI355X等产品迭代,以及PyTorch、Megatron等框架对ROCm的原生支持增强,未来一年内我们可能会看到更多大模型RL训练跑在AMD集群上。对于有预算约束或希望降低对单一供应商依赖的企业,现在正是开始积累AMD RL训练工程经验的最佳时机。