原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.15029
立即前往原文

Pick Your Poison:选择投毒数据集以增强对大语言模型的后门攻击

一项研究表明,大语言模型后门攻击的成功率高度取决于微调时选择哪些投毒样本。在三种基于 LLaMA-3-8B 的后门设置中,即使模型、干净数据和投毒样本数量完全相同,攻击成功率仍在 3% 到 80% 之间变化。研究人员将投毒数据集选择形式化为预算约束下的集合优化问题,并提出 SAILS。该方法通过数百次微调和评估,学习为数百万个候选数据集排序。与最强的基于影响力的基线方法相比,SAILS 在留出数据上的攻击成功率平均提升了 30 个百分点,并可扩展到代码生成、智能体系统和仅通过 API 实施的后门攻击。
行业资讯 伦理与安全 AI模型 研究 2026-09-15 12:30:57 135 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。