梯度如何加剧分割式语言模型的文本泄漏:按词元和文档衡量
一项研究测量了分割学习过程中传输的激活值和梯度能够泄露多少文本。在 GPT-2 实验中,拥有公开权重的攻击者仅凭激活值就能恢复 94.20% 的词元;若同时获得梯度,比例升至 97.38%。32 个词元的文档被完整恢复的比例则从 13.71% 升至 37.77%。Secret mixup 防御几乎阻止了整份文档被准确恢复,但仍有 83% 至 91% 的词元可被还原。研究表明,激活值和梯度都可能泄露敏感文本。研究人员建议同时按词元和文档报告泄漏情况,并将传输的表示数据视为与原文同等敏感。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。