Pick Your Poison:选择投毒数据集以增强对大语言模型的后门攻击
一项研究表明,大语言模型后门攻击的成功率高度取决于微调时选择哪些投毒样本。在三种基于 LLaMA-3-8B 的后门设置中,即使模型、干净数据和投毒样本数量完全相同,攻击成功率仍在 3% 到 80% 之间变化。研究人员将投毒数据集选择形式化为预算约束下的集合优化问题,并提出 SAILS。该方法通过数百次微调和评估,学习为数百万个候选数据集排序。与最强的基于影响力的基线方法相比,SAILS 在留出数据上的攻击成功率平均提升了 30 个百分点,并可扩展到代码生成、智能体系统和仅通过 API 实施的后门攻击。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。