原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.16204
立即前往原文

Decoy Direction Optimization:防御 LLM 消融攻击的后处理方法

开放权重语言模型的安全护栏可能被拒绝特征消融(RFA)绕过。该技术会从残差流中识别并移除代表拒绝行为的线性方向,同时通常保留模型的通用能力。Decoy Direction Optimization(DDO)是一种快速的后处理防御方法,无需针对每个新模型检查点重新进行基础模型微调。它在 MLP 神经元中注入高幅度的非线性诱饵信号,使攻击者误以为找到了拒绝方向,转而消融一个无害的正交特征,而实际的安全机制仍保持完整。研究通过谱界对这一效果进行了形式化分析,并在六个模型系列上评估了 DDO。提供的描述未包含具体数值结果。
行业资讯 伦理与安全 AI模型 研究 2026-09-16 13:30:57 308 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。