强化学习(RL)微调已成为提升视觉语言模型(VLM)任务表现的主流范式,但一项来自Apple机器学习研究的系统性工作揭示了其反直觉的副作用:基准分数上升的同时,模型的推理链可靠性与上下文鲁棒性可能严重退化。这一发现对正在用RL打磨多模态模型的团队构成重要警醒。
研究团队通过简单的文本扰动——例如使用误导性标题或插入错误的思维链(Chain-of-Thought, CoT)——对经过RL微调的VLM进行测试。结果清晰显示,微调后的模型在面对这些微小对抗性输入时,鲁棒性显著下降,置信度发生偏移。更具启示意义的是,开源模型表现出比闭源模型更剧烈的衰退,而闭源模型虽呈现类似的失败模式,但整体鲁棒性与推理一致性明显更强,暗示了训练数据质量与架构设计的潜在影响。
核心发现指向一个深层矛盾:准确性与忠实性之间存在根本性的权衡。RL微调在提升模型在标准基准上的准确率时,同时侵蚀了CoT的可靠性和模型对上下文变化的敏感度。即使引入对抗性增强(adversarial training)来改善鲁棒性,也无法阻止忠实性漂移——模型依然可能输出与自身推理链相矛盾的答案。更为棘手的是,当团队尝试加入忠实性感知奖励(faithfulness-aware reward)来重新对齐答案与推理过程时,该机制与增强训练结合往往导致训练崩溃,模型转而学习“捷径策略”,即简单重复训练集中的模式而非真正理解视觉与文本的关系。
从行业视角看,这一现象并非孤例。大语言模型领域已有研究指出RLHF可能损害事实一致性,而多模态模型中视觉与文本的交互进一步放大了风险。在实际应用中——例如自动驾驶视觉理解、医疗影像报告生成或金融图表分析——一个“看似正确”但推理链不可靠的模型可能带来致命错误。苹果团队强调,单纯追求基准分数是不够的,必须联合关注正确性、鲁棒性与视觉推理的忠实性。
对于从业者,建议采取两条并行路径:第一,在RL微调阶段引入多维度的鲁棒性评测,包括对抗性文本扰动和CoT一致性验证;第二,探索更稳定的忠实性对齐机制,例如结合过程监督(process supervision)与动态奖励设计,避免训练崩溃。这一研究也提醒我们,当模型“变聪明”时,我们需要更谨慎地检验它是否真的在思考。