一次看似微不足道的shell变量展开错误,让知名AI创业者Matt Shumer失去了他Mac硬盘上数年代码、文件和照片。肇事者是OpenAI最新的Agent模型GPT-5.6-Sol——一个被赋予文件清理任务的本地Agent。在开启Full Access权限后,subagent执行的rm -rf命令将环境变量$HOME错误解析为绝对路径/Users/mattsdevbox(而非标准/Users/matt),进而删除整个用户目录。令人震惊的是,这一任务此前已在同一环境中安全运行了数百次。
事故发生后,Agent自动生成了一份事故报告,承认执行路径与预期不符。Matt在社交媒体上直指“这感觉像是GPT-3.5才会犯的错误”,并明确表示“1000倍更信任Anthropic的Fable”。虽然Fable模型尚未正式公开,但此言折射出业界对模型安全底线的真实态度:顶级模型在最基础的操作语义上仍然脆弱。
这起事件的价值远超一次数据丢失,它暴露了当前Agent架构的三大核心风险。第一,语义理解的“最后一公里”问题:即便是GPT-5.6-Sol这一级别的模型,在处理shell变量展开、路径拼接等低级操作时,仍可能因上下文模糊或训练数据覆盖不足而翻车。这并非模型推理能力的失败,而是“懂意图,却不精细节”的系统性短板。第二,架构级的灾难放大器:Subagent(子代理)分拆任务、长时间自主运行(无实时人工确认)加上全磁盘读写权限,三者组合就像一个“故障放大器”——任何一环的微小偏差都可能被链式放大成毁灭性后果。第三,厂商安全理念的鸿沟:从Matt对Anthropic的公开信任可以看出,不同团队在权限默认值、沙箱隔离、关键操作确认机制上的设计差异巨大。OpenAI目前仍以“通用能力优先”,安全更多依赖用户配置,而像Anthropic的“Constitutional AI”思路则更注重在模型层内置安全护栏。
对于每一个正在将Agent投入生产环境的使用者,这起事件提供了几项务实警示。首先,永远不要给Agent“全盘权限”——即使任务逻辑简单,也应通过操作系统级别的文件系统快照、限制操作范围到临时目录。其次,关键操作必须设置人工确认点,特别是带有rm -rf、dd等不可逆命令时,Agent应触发二次授权。最后,需要建立Agent行为的可审计日志和自动回滚机制,让每一行执行指令都能被追踪。
从行业趋势看,Agent正从“对话式工具”向“自主执行者”快速演进。GPT-5.6-Sol的失误并非某个模型的孤立缺陷,而是整个行业在“能力先行、安全滞后”阶段必须付出的代价。未来,我们或许会看到两大变革:一是模型厂商在预训练或RLHF阶段就加入“shell执行安全知识”,让模型能识别危险命令模式;二是Agent框架的底层架构会引入严格的沙箱和权限分层,类似移动操作系统的应用权限模型。在此之前,每个选择放权给AI的人,都需要重新评估那句老话:信任,但一定要验证。