标题:大模型研究智能体成“信息拼图师”?私密文档数据遭遇“马赛克攻击”
摘要:研究揭示多跳查询智能体会将分散的私有信息“拼凑”成完整泄露。测试显示,单纯优化任务性能反加剧隐私风险。基于此提出的隐私感知训练新方法PA-DR,将私有信息泄露率从34%压降至9.9%,同时任务成功率提升至58.7%,为企业级AI部署敲响警钟。
当企业将AI研究智能体接入内部知识库时,一个隐蔽却致命的漏洞正在浮现:这些智能体在多次、跨文档的查询中,会像拼图一样将本地私有文档与公共网页信息“马赛克”式拼接,最终暴露不应外泄的敏感数据。这种被称为“MosaicLeaks”的现象,正在给企业级AI应用带来新的安全挑战。
研究团队构建了一个包含1,001条多跳研究链的新型基准任务。每条链都精心设计了交替穿插的私有与公共子问题——比如先问“公司Q3毛利率”,再问“行业平均毛利率”,最后问“毛利率差异的主要原因”。这种模拟真实业务场景的复杂查询,恰好暴露了深度研究智能体的致命弱点。
实验数据令人警醒:在未加防护的情况下,智能体频繁将本地文档中的敏感信息直接输出。更值得注意的是,当研究人员单纯优化任务完成效率(如追求更高的检索召回率)时,隐私泄露率反而同步飙升——这意味着传统“跑得更快”的优化思路,正在与安全目标背道而驰。
这一发现揭示了Deep Research agent的本质矛盾:多步推理天然需要跨上下文聚合信息,而聚合本身就成了隐私的“反编译器”。简单提示“不要泄露隐私”几乎无效,因为智能体无法自主识别哪些信息组合构成“敏感拼图”。
针对此困境,研究团队提出隐私感知深度研究(PA-DR)强化学习训练方法。该方法在奖励函数中引入隐私约束项,严格限制信息跨域拼接行为。测试显示,PA-DR将严格链成功率从48.7%提升至58.7%,同时将答案/全面信息泄露率从34.0%骤降至9.9%。安全性提升并未以牺牲任务表现为代价,这是一个关键突破。
这一成果为企业级agent产品敲响警钟:“黑箱”式的大模型应用可能存在单向透明的隐忧——用户看不见内部推理过程,但敏感信息却可能通过Agent的多次调用被一步步带出。对于部署企业知识库、合同审核、内部咨询等场景的团队,这不仅是技术问题,更是合规风险。
从长远看,隐私感知训练应成为agent系统的默认组件,而非可选的“高级设置”。企业需要建立跨文档查询的审计机制,对多跳推理路径进行实时监控。同时,这篇论文也启示我们:安全与效率并非零和博弈,精心设计的隐私约束机制完全可以实现“鱼与熊掌兼得”。