一、一场特殊的“首秀”
在大型语言模型的RL训练世界里,NVIDIA的GPU几乎是唯一的选择。当DeepSeek-V4 Flash的RL训练完整跑在AMD Instinct MI355X上,这不是一次简单的硬件替换,而是一个信号:在非NVIDIA生态中训练大规模MoE模型,从“理论上可行”进入了“实操可复现”的阶段。
LMSYS团队这次放出的不是PR稿,而是带实测数据的实战报告。2840亿参数、每token激活130亿参数的MoE模型,在4个八GPU节点上完成了超过100个优化器步骤的RL训练。这个规模在非NVIDIA集群上完成端到端验证,本身就值得行业关注。
二、技术拆解:三层核心挑战
整个训练链路并非简单的“一键迁移”。Miles框架需要同时协调三个核心组件:SGLang负责rollout生成、Megatron处理策略更新、Miles自身管理异步循环与权重同步。这种复杂架构在NVIDIA平台上已有成熟方案,但在ROCm软件栈上复现时,团队遇到了三个关键挑战:
- 模型对齐:SGLang与Megatron在模型参数、中间表示上的精度差异,可能导致rollout与训练阶段的log-prob不一致
- 量化状态在线更新:RL训练过程中,模型量化参数需要在每个token级别同步更新,增加了跨节点通信的复杂性
- 多节点并行稳定性:8个GPU节点32卡集群中,需要解决因通信拓扑差异导致的梯度同步抖动
团队最终给出的验证数据相当扎实:训练-rollout对数概率差控制在合理范围内,在线奖励持续提升,离线AIME-2024基准分数同步上涨。这意味着RL训练的有效性没有因为硬件栈变化而打折扣。
三、行业价值:从“能不能跑”到“跑得好不好”
客观来说,当前NVIDIA生态在RL训练上仍然占据绝对优势,无论是工具链成熟度还是社区支持。但这次验证的意义在于:它为依赖AMD硬件的团队提供了可落地的“踩坑路线图”。对于算力预算有限、或者被NVIDIA供货周期拖累的团队,这可能是一个现实的选择。
值得注意的细节是,这套方案基于ROCm软件栈运行,SGLang与Megatron的双引擎协同模式与NVIDIA平台的HuggingFace生态不同,这要求团队在工程上做更多适配。但正如LMSYS团队所展示的,这些挑战并非不可逾越。
四、未来判断:RL训练生态正在去中心化
DeepSeek-V4 Flash案例的价值不止于一次成功的迁移。它表明,当算力成为制约RL训练的主要瓶颈时,硬件生态的多元化可能是破局的一种思路。AMD MI355X在推理和训练上的表现正在逼近NVIDIA高端卡,而ROCm的成熟度也在快速提升。
如果团队正在寻找NVIDIA之外的RL训练方案,LMSYS给出的这个案例值得仔细研究。它不仅是“能跑”的证明,更是“如何跑好”的实战指南。随着更多像Miles这样的框架出现,RL训练的硬件选择将不再局限于单一生态。