可拆卸神经元模块:Anthropic为AI有毒知识装上“可控开关”

大模型的安全对齐一直面临两难:既要防止模型输出危险知识,又要保留其有益能力。传统的拒绝训练(refusal training)往往只能抑制表面输出,难以根治底层知识;事后遗忘(unlearning)技术则可能损伤通用能力,甚至可被逆向恢复。Anthropic与AE Studio最新提出的梯度路由辅助模块(GRAM),正在尝试跳出这一困境——他们给AI装上了可拆卸的“知识开关”。

GRAM的核心思路是在Transformer的每一层额外添加一组神经元模块,这些模块通过梯度路由机制,在训练时仅让病毒学、网络安全、核物理、专业编程语言等双重用途(dual-use)知识流入这些模块,而非散入整个模型参数空间。这意味着,模型的主干参数完全不受这些敏感知识的影响,其通用性能得以保全。更关键的是,这些模块可以“即插即用”:“保留”时,模型拥有完整敏感能力,可供可信环境部署;“删除”后,模型对该能力的记忆几乎不可恢复——因为知识从未进入主干。

研究团队在合成数据、真实数据以及从50M到5B参数的模型上进行了系统测试,结果相当扎实:GRAM的效果与直接数据过滤(filtering)相当,但后者需要完全舍弃数据,而GRAM保留了按需激活的可能性;相比事后遗忘技术,GRAM在删除模块后几乎无法通过微调或提示技巧重新找回被移除的能力,鲁棒性显著提升。此外,移除模块并未导致模型在通用基准(如语言理解、推理)上的性能下降——模块本身就是独立的“能力容器”。

这一方法的优劣不言而喻。一方面,它极大优化了知识管控的粒度:开发者可根据部署场景灵活组合模块,比如在医疗场景保留病毒学知识而关闭核物理模块;另一方面,模块化设计天然支持审计与安全审查——模块参数可直接作为合规证据。不过,这并不意味着它已完全成熟。实验规模仅到5B参数,在更大模型上的路由效率和模块数量扩展性仍需验证;而且该方法目前尚未上线Claude,距离工程化落地还有距离。

从行业趋势看,GRAM代表了一种范式转换:从“教模型不要做什么”转向“让模型学会只在特定区域做什么”。未来,大模型的安全对齐很可能演变为一套模块化知识治理体系——开发者像搭建乐高一样组合敏感能力模块,并在部署前按要求拆除或保留。这对于平衡AI的开放性与安全性,提供了一个比现有方法更可操作、更可验证的路径。对于AI从业者而言,关注并尝试这类“可解耦安全”方案,或许能提前为监管合规与产品责任找到更优的解决方案。