模型内部信息何时有帮助?探讨表征工程在大语言模型安全中的作用
一项对照评估比较了基于行为的安全防护措施,以及读取或修改模型内部状态的方法。在安全控制方面,DPO 的整体表现最强,但通常会受益于更多训练数据,并且在后续使用良性数据微调后,安全性可能下降。表征引导方法主要在低数据量场景下具有竞争力,尤其是在使用高质量对比数据时。在安全监测方面,专门的文本监测器检测准确率最高;表征探针则以显著更低的边际成本保持竞争力。监测器引导的干预可以恢复良性微调后损失的大部分安全性,同时几乎不会增加过度拒答。研究认为,表征工程通常无法取代基于行为的安全防护,但在特定条件下能够提供实用的互补作用。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。