研究人员发现可从专有 LLM API 窃取推理轨迹的漏洞
一项研究发现,主要 LLM 提供商在客户端处理加密思维链数据时存在架构漏洞。这些加密区块似乎可以在同一提供商的不同会话、用户和模型之间互换。攻击者可将更强模型生成的推理轨迹注入较弱且防护较少的模型,迫使后者解码并以明文输出隐藏推理。研究人员已在 Anthropic、OpenAI 和 Google 的系统中验证这一方法。他们分析了从公开代码库获取的 315,320 个推理区块,找出 367 条个人身份信息和 182 份凭据。该漏洞还可能绕过模型蒸馏防护,暴露推理过程中的危险信息,并通过加密区块实施隐蔽的提示注入攻击。研究人员在负责任披露后提出了加密和系统层面的缓解措施。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。