不靠拒答来拒绝:减少语言模型误拒的安全调优响应结构分析
该研究分析了语言模型为何会因无害请求中出现表面上具有风险的词语而错误拒答。研究人员将安全调优数据集中的响应拆分为模板化拒答语句和拒答理由说明。实验表明,拒答语句会促使模型依赖表面线索,从而难以区分有害请求与无害请求。仅使用理由说明进行训练,可以在保持相近安全性能的同时减少误拒。该效果也出现在上下文学习设置中,并且与研究评估的推理时缓解方法兼容。研究结果强调了精确、细粒度安全监督数据集的重要性。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。