在AI领域的多模态模型训练中,强化学习通常扮演着关键的“对齐”角色,但其工程实现长期面临一个核心痛点:不同模型——如大语言模型(LLM)与扩散模型——的强化学习训练流程迥异,导致开发者在模型切换时需重写大量代码,并面临算法与框架的双重适配成本。腾讯混元团队近日推出的开源框架UniRL,试图从底层基础设施层面解决这一碎片化问题。
UniRL的核心设计在于其“统一后训练循环”,即通过“生成→评分→优势→更新→同步”的单一路径,覆盖包括扩散/流匹配模型、LLM/VLM(视觉语言模型),以及统一多模态模型(如混元Image-3和Bagel)在内的多种架构。值得注意的是,该框架将“模型类型”与“算法策略”作为两个相互独立的轴,实现了“模型×算法”的灵活组合。这意味着,同一套强化学习算法可无缝迁移至不同类型的模型上,或是对同一种模型尝试不同的算法优化,极大减少了工程重复。
在工程实现上,UniRL的兼容性设计同样值得关注。它提供了可插拔的Rollout引擎,分别面向训练侧、SGLang以及vLLM-Omni这三种不同的推理与采样环境。此外,框架原生支持FSDP2(完全分片数据并行)分片,并内置了三种部署模式,以应对从研究验证到大规模训练的不同资源需求。这些特性并非简单的功能堆砌,而是针对多模态训练中常见的资源瓶颈(如长序列生成、混合精度需求)给出的系统级答案。
在算法层面,腾讯混元此次随UniRL发布了两个新算法:Flow-DPPO 与 DRPO。Flow-DPPO专门针对流模型与扩散模型设计,其创新在于引入“基于精确散度的信任域策略优化”,这比传统的信赖域策略优化(如TRPO)在扩散模型的连续潜空间上可能具有更高的样本效率与稳定性。这与单纯依赖奖励信号的做法不同,它试图从数学上保证策略更新的保守性,从而避免模型在奖励信号稀疏时产生震荡。另一算法DRPO则关注LLM的强化学习,它提出一种平滑的优势加权二次正则化方法,在优化策略时减轻过拟合风险,这为偏好对齐任务(如RLHF)提供了新的优化视角。
对于专注于多模态对齐的实践者而言,UniRL的代码开源意味着可以直接fork代码进行实验,而无需从头搭建复杂的训练回路。这一动作很可能加速行业从单一模态强化学习向统一多模态强化学习基础设施的过渡。观察当前趋势,模型架构的收敛与训练框架的统一正在同步发生,UniRL正是后者的典型代表。未来,随着扩散模型和LLM在推理与Agent任务中的深度耦合,具备此类统一能力的强化学习框架,或将成为支撑多模态Agent训练的标准组件。