PrivacyPeek 审计 LLM 智能体获取了什么,而不只是它们说了什么
基于 LLM 的智能体越来越多地调用外部工具,自主完成多步骤任务,但它们经常获取超出任务所需范围的敏感信息。PrivacyPeek 是一个评估“获取阶段”隐私泄露的基准,关注数据首次进入智能体上下文、尚未出现在回复或外部操作中的阶段。该基准包含 1,182 个案例,覆盖 7 种获取行为和 16 个应用领域。它分析智能体的工具调用轨迹及接收的数据,并测试攻击者能否轻易诱导智能体泄露其已获取但未公开的敏感信息。对来自 4 个模型系列的 10 个智能体进行的实验表明,不必要的信息获取普遍存在,并且与任务完成能力相关。基于提示词的防御只能缓解少部分泄露问题。数据集和代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。