Meta用“伪装未成年人”攻防测试,撕开AI安全测试的灰色阳谋

当全球AI公司竞相宣称自己的模型“安全可控”时,一场由行业巨头Meta主导的秘密测试,正无情地戳破这层窗户纸。这并非官方漏洞赏金计划,也非自愿的第三方安全审计,而是一场代号“Cannes”的、针对竞争对手发起的系统性“红队”测试。根据《连线》的报道,Meta通过外包公司Covalen,让数百名外包人员伪装成未成年人,向ChatGPT、Gemini以及Character.AI等热门平台狂轰滥炸,押注对手的安全防线会在“未成年人”这张王牌面前短路。

这项行动并非简单的“钓鱼”。 Meta外包人员炮制了大量18岁以下用户的虚假身份,上传药片、刀具等直观图片,并输入精心设计的、涉及自杀、自残及进食障碍的高风险提示词。单轮测试中,发送的提示词就超过4.5万个,攻势凌厉。其核心目的,是检验竞品聊天机器人面对这类极端儿童话题时的安全拦截机制——究竟是真能识别风险并“拒绝回答”或“转介帮助”,还是会掉入“虚假共情”的陷阱,给出诱导性甚至有害的回应。

Meta对此事的官方说法是“常规安全测试”,并坚称不会将这些从竞品引出的数据用于训练自家模型。但这番“澄清”恰恰暴露了行业内的深层困境:当AI的安全测试完全仰仗企业自律,且缺乏统一、中立的行业标准时,这种“以彼之道,还施彼身”的策略,就不可避免地带上了工业间谍的色彩。 它不再是纯粹的“技术对抗”,而是商业竞争在安全域的一种延伸。Meta投入如此规模的人力与资源,显然不仅仅是为了“做好事”。

更值得警惕的是此次行动暴露出的技术脆弱性。对比可见,各大模型在面对极端儿童话题时,表现参差不齐,且普遍存在“语境迷航”——比如,当模型识别到“未成年人”与“药片”的组合时,逻辑防火墙应迅速启动针对儿童的安全策略,但测试结果很可能证实,许多模型依然会将其误判为普通医疗咨询,进而给出危险回复。这直接拷问了AI公司赖以骄傲的“安全护栏”究竟有多坚固。

与其说Meta是在做安全测试,不如说它是在借用最“黑”的视角,为整个行业敲响警钟。ChatGPT、Gemini等模型的开发者们,自诩为安全先行者,但测试表明,它们的模型在“未成年人”这面照妖镜下,依然漏洞百出。这揭示了一个残酷的现实:AI安全的真正瓶颈,不在于大模型的能力上限,而在于能否精准地执行那些“绝对红线”。 任何一次对儿童安全规则的疏忽,都可能导致不可逆转的伦理灾难。

目前,这项代号“Cannes”的项目已于4月21日到期,但留存的疑云并未消散。对于行业而言,当头部公司放下身段,用近乎“侵略”的方式去暴露对手弱点时,AI安全测试的灰色地带正被彻底撕开。Meta的行动虽然是基于竞争动力,但其方法论——即大规模、高成本的模拟极端高危场景——是当前所有AI平台必须引以为鉴的。防止AI伤害未成年人,不应该是企业的营销口号,而应是一场需要全行业无差别、高标准、常态化进行的“压力测试”。 Meta的“阳谋”恰恰证明了:如果缺乏行业通行的测试标准,那么每家公司的安全白皮书,都只是徒有虚表的注脚。这场测试的最优结局,是促使所有AI公司不再单单依赖依赖自夸的“道德黑盒”,而是将儿童安全防护真正内化到模型训练与迭代的底色之中。否则,下一个引发公关危机的,就将是你最常用的那一个聊天机器人。