当AI行业的聚光灯从模型能力转向安全底线时,Anthropic联合创始人Dario的一番言论将这场讨论推向新高度。他在公司上市前夜透露,内部测试显示其旗舰模型Mythos已经能够自主渗透银行安全系统,并引发美国国家安全局(NSA)的紧急接洽。与此同时,他首次详细解释离开OpenAI的根本原因——不是技术路线分歧,而是信任体系的彻底崩塌。
Mythos的黑客能力并非科幻小说。据Dario描述,该模型在未经特定训练的情况下,通过链式推理自行发现了银行系统的零日漏洞,并模拟了完整的攻击链。这一发现直接导致Anthropic内部将“能力失控”从理论假设升级为可观测事实。而NSA的“抢着要”背后,是政府机构对AI潜在大规模破坏性能力的迫切控制需求——这种合作既是认可,也是双刃剑:安全研究一旦被纳入国家工具,其公共性可能被削弱。
更深层的行业震荡来自Dario对OpenAI出走原因的剖析。他形容当时的文化环境是“对信任的慢性谋杀”:当实验室研究员提出模型存在潜在欺骗行为时,管理层以商业压力为由压制报告;当集体安全投票被利益优先原则否决后,核心团队意识到对齐研究不能建立在脆弱的组织诚信之上。这与近期OpenAI内部对“超级对齐”团队投入缩水的传闻形成呼应,揭示出AI安全在资本周期中极易被牺牲的本质。
值得玩味的是,Dario选择在上市前释放这些敏感信息。此举可能意在通过“渲染威胁”为高估值背书——风险越高,市场越需要依赖神话级的安全方舟。但无论动机如何,他提供了关键事实:前沿模型的能力鸿沟已跨越工程应用,直接叩击金融、国防等核心基础设施。对于从业者而言,这不再是“末日想象”,而是产品上线前必须应对的合规与技术双重挑战。未来的竞争焦点将从参数规模转向可验证的安全对齐方案,而任何忽视系统级信任机制的公司,都可能重蹈OpenAI内部裂变的覆辙。