Decoy Direction Optimization:防御 LLM 消融攻击的后处理方法
开放权重语言模型的安全护栏可能被拒绝特征消融(RFA)绕过。该技术会从残差流中识别并移除代表拒绝行为的线性方向,同时通常保留模型的通用能力。Decoy Direction Optimization(DDO)是一种快速的后处理防御方法,无需针对每个新模型检查点重新进行基础模型微调。它在 MLP 神经元中注入高幅度的非线性诱饵信号,使攻击者误以为找到了拒绝方向,转而消融一个无害的正交特征,而实际的安全机制仍保持完整。研究通过谱界对这一效果进行了形式化分析,并在六个模型系列上评估了 DDO。提供的描述未包含具体数值结果。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。