安全是为了谁?面向受控大语言模型安全拒答的边界感知自蒸馏
该研究考察具有狭窄边界的安全对齐:模型可能需要拒绝有针对性的政治操纵,同时仍回答关于同一场选举的事实性问题。研究提出一种离线自生成框架,结合受控主题生成、覆盖度修复、分布内补偿数据,以及有害—无害配对数据。在 Qwen3-8B 上,目标领域的拒答率从9.47%提升至84.75%,三个更广泛有害性基准中的平均不安全响应率从26.26%降至0.14%。但XSTest中的过度拒答率从2.00%升至74.00%。结果表明,数据构成会显著影响安全性与可用性之间的权衡,安全评估应同时衡量对有害请求的拒答和对无害请求的不当拒答。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。