AI安全对齐迎来一个关键转折点。传统的做法——通过拒绝训练或事后“遗忘”技术来限制模型输出有害知识——往往陷入两难:要么过度压制导致通用性能下降,要么防线脆弱,对抗性攻击即可绕过。Anthropic与AE Studio联合发布的研究提出了一种截然不同的思路:梯度路由辅助模块(GRAM),它允许开发者像“插拔芯片卡”一样,将病毒学、网络安全、核物理、专业编程语言等双重用途知识从模型全局结构中隔离出来,只在需要时“安装”,部署后即可轻松“卸载”,而不会影响模型其余能力。
该方法的核心理念在于知识路由。传统Transformer中,训练数据中的任何信息都会扩散至所有参数,形成全局关联。GRAM通过在每层Transformer中添加可移除的神经元模块(辅助模块),并在训练过程中使用梯度路由机制——即仅让这些“毒知识”通过模块的梯度流更新,而主网络梯度保持独立——从而迫使模型将这些特定领域的表征只编码在模块内部,而非全局参数中。训练完成后,删除模块即可安全消除该能力,保留模块则可部署给可信用户使用。这种设计在训练时不需要对数据本身进行过滤或干预,而是通过架构层面的“记忆隔离”实现精确控制。
实验在多组设定下系统验证:在合成数据(模拟双重用途知识分布)、真实数据(专业编程语言与网络安全语料)以及模型规模从50M到5B参数的多个架构上,GRAM在保留目标知识(如回答特定编程问题)的同时,消除模块后该知识基本归零。其效果与最严苛的“数据过滤”基准相当,但后者需要预先识别并剔除所有敏感数据,不具备灵活开关的能力。更关键的是,移除模块后模型的通用语言理解、推理能力几乎不受影响——这与传统的“遗忘”方法不同,后者往往在削弱特定能力时连带损害模型在无关领域的表现。此外,研究团队发现,GRAM比目前流行的“模型遗忘”技术(如梯度上升遗忘)更难通过对抗性攻击恢复:即使攻击者知道模块结构,也需要重新训练才能让模块重现,而事后遗忘的模型往往通过微调可轻易复原。
这一成果的价值不止于技术实现。它重新定义了AI安全对齐的可操作边界:过去我们只能在“训练前过滤数据”和“训练后削弱能力”之间做取舍,两者都缺乏动态性。GRAM提供了第三种选择——在训练阶段就将知识“模块化”,实现能力与安全的可编程分离。试想,一个医疗AI模型可以预装病毒学模块供实验室使用,但在部署为公共助手时直接拔掉该模块,既保证了药物研发的效率,又避免了滥用风险。这比当前主流“拒绝回答”策略(如Claude、GPT的安全限制)更灵活,因为后者无法区分“可信”与“不可信”使用场景,只能一刀切地限制所有用户。
当然,该方法尚未落地商品化(目前未应用于Claude),且存在潜在挑战:模块规模如何影响推理效率?是否会在大型模型中引入额外延迟?将知识隔离到模块中是否意味着攻击者可以通过逆向工程定位并复制模块?这些问题有待后续研究。但无论如何,GRAM为AI行业提供了一条“可治愈安全性”的路径——就像软件工程中通过依赖注入实现功能开关一样,它让模型安全对齐从“固化特性”转向“可配置能力”。对于正在探索合规部署的企业而言,关注这一方向可能比单纯依赖“红队测试”或“审查列表”更具前瞻性。