一场围绕“AI安全”的隐秘较量正在科技圈悄然上演。据权威媒体《连线》披露,Meta通过外包公司Covalen开展代号“Cannes”的项目,让数百名外包人员伪装成18岁以下未成年人,向OpenAI的ChatGPT、谷歌的Gemini以及Character.AI等竞品发送大量涉及自杀、自残、进食障碍等高风险提示词。这场持续至4月21日的测试,单轮便发动超4.5万个指令,并利用虚假账号上传药片、刀具等敏感图片。Meta对此称其为“常规安全测试”,但这一举动却在业界引发了广泛争议。
从项目细节来看,Meta的测试手法极具针对性:外包人员需伪装成13-17岁的青少年,设计出符合这一心理特征的语言逻辑,并刻意挑衅竞品AI的敏感话题边界。当AI平台未能触发安全拦截机制时,测试数据即被记录。这一行为暴露出当前AI安全测试领域存在的灰色地带——竞品企业之间如何界定“合法安全测试”与“恶意渗透”?Meta声称不会将测试数据用于训练自家模型,但这一“保证”在商业利益的诱惑下难以打消外界质疑。
实际上,这不是硅谷巨头首次在AI安全领域“擦边”。过去几年中,多家AI厂商曾因聊天机器人向未成年人输出不当内容而陷入舆论危机。2023年,某知名AI平台因未有效识别用户年龄,导致一名儿童在对话中获取自残方法。相比之下,Meta此次测试更像一场“以毒攻毒”的行业警示:它揭示了即便经过多轮安全测试,主流AI模型在面对精心伪装的儿童极端话题时,仍然存在大量响应漏洞。
值得玩味的是,Meta选择在这一时间节点高调曝光安全测试计划,背后可能暗藏技术战略升级的意图。当行业内各家公司都在宣扬“负责任AI”时,Meta用最原始的方式——诱导AI越界,来验证竞品的安全底线,这迫使整个行业必须正视一个问题:基于统一标准化测试框架的AI安全评估体系,是否已经迫在眉睫?
对于AI开发商而言,Meta的举动无疑是一面警钟。未来,若企业在安全测试中不设立清晰的伦理边界,类似的“伪装测试”可能引发更严重的反噬风险,甚至沦为商业打压的工具。行业亟需共同制定一套跨公司的安全测试准则,明确“什么能测、什么不能测”,以避免技术监督异化为无底线的“军备竞赛”。在AI走向社会化的关键阶段,任何对安全底线的试探,都应以公共利益为最高考量。