CLEAR:在保持实用性的同时实现大语言模型安全对齐的连续潜在适配器路由
CLEAR是一种大语言模型安全对齐方法,通过隐藏状态中的轻量级门控机制,连续控制安全低秩适配器的激活强度。该方法旨在减少有害回答,同时避免对良性提示下的基础模型进行不必要的修改。在Llama-3-8B-Instruct测试中,CLEAR将HarmBench攻击成功率从32.3%降至0.5%,并保留了模型大部分实用性。在GSM8K准确率方面,其表现也比全局应用的SFT或LoRA高出最多7.1个百分点。要验证其泛化能力,仍需开展更大范围的独立评估。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。