原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.04382
立即前往原文

分割式 LLM 训练存在隐私漏洞:返回的梯度会暴露诱饵数据行

一项针对双节点分割式 LLM 训练系统的系统安全研究发现了一个此前未测试的可观测信息泄漏通道。云端节点接收由真实数据行和诱饵数据行混合组成的数据帧,而本地节点只对真实数据行计算损失。因此,诱饵数据行的梯度精确为零,从而暴露哪些数据行是真实的。在九次运行中,每个数据帧的 4,096 个真实数据行都被准确识别。针对数据帧内容的攻击相比固定猜测基线每百个 token 约多恢复一个 token;随机打乱标签的对照实验则没有恢复结果。对梯度逐行进行裁剪和加噪可以关闭这一泄漏,代价是留出数据交叉熵增加约 0.01 nat。不过,包括跨训练步骤累积观测的攻击在内,另外五类攻击尚未被测量。
行业资讯 伦理与安全 研究 2026-09-09 06:01:20 664 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。