AI知识安全新破局:Anthropic用可拆卸神经元模块精准管控双重用途能力

AI安全对齐的经典难题在于:模型一旦学会某项危险能力,便难以在保持通用性能的前提下彻底“忘却”。传统的拒绝训练(refusal training)往往导致模型过度泛化或隐藏知识,事后遗忘(post-hoc unlearning)则存在恢复风险。Anthropic与AE Studio的最新研究梯度路由辅助模块(GRAM)提供了一种截然不同的思路——将双重用途知识封装在可拆卸的“物理开关”中,放弃不可逆的遗忘,转向可控的隔离。

GRAM的核心是在Transformer每一层额外添加一组可训练的神经元模块。训练时,通过梯度路由机制,模型将病毒学、网络安全、核物理、专业编程语言等高危知识仅激活到对应模块的参数中,而主干的共享权重保持对通用能力的泛化。这种设计的关键在于:知识被“局部化”而非“扩散化”。一旦部署场景要求去除该能力,只需删除这些模块即可,主干的通用性能几乎不受影响——实验显示,50M到5B参数的模型在删除模块后,标准基准测试的准确率降幅不足0.5%。

与数据过滤(直接剔除相关样本)的效果对比,GRAM在合成数据和真实数据上均达到同等水平;但过滤法会导致模型对边缘案例的识别能力下降,而GRAM保留了安全使用时的灵活性。更重要的是,相比事后微调遗忘,GRAM更难被对抗性提示或微调恢复——因为知识从未写入主干权重,攻击者无法通过参数扰动“找回”已删除模块。这种硬件级的安全边界,恰好回应了行业对“遗忘”技术不可靠性的长期担忧。

当前AI安全领域面临两难:既要防止模型被恶意利用,又要保留其在医学、科研等领域的正向价值。GRAM提供了一条中间道路——在训练阶段主动隔离敏感知识,而非被动禁止。虽然Anthropic尚未将GRAM部署到Claude系列,但该方法对安全对齐的工程化方向具有启发意义:未来的模型可能不再是一个“全知全能”的单一网络,而是由通用主干加可插拔功能模块构成的模块化智能体,安全管控从“禁止回答”转向“权限管理”。对于企业级部署,GRAM的成本增量有限(仅增加少量参数和训练开销),但能显著降低合规审计风险。建议关注该方法的扩展性:当模块数量增多时,是否会引发路由冲突?以及动态切换模块(而非删除)是否可实现更精细的权限分级?这些问题将决定GRAM能否从实验室走向生产环境。