利用隐藏状态相对表示检测大语言模型偏见
一项研究提出了一种基于参照的偏见审计方法,通过分析大语言模型的隐藏状态表示来检测偏见。该方法根据句子与固定锚点句集合的相似度对句子进行编码,使微调前后的模型变体即使内部表示结构发生变化,也能在统一的比较空间中进行分析。研究者提出“表示偏见变化”指标ΔB,用于衡量目标群体与正面、负面属性之间关联的变化。在三个模型系列的18种测试设置中,ΔB有15次与输出层面的偏见变化相关,最高相关系数为|r| = 0.84。通过设置ΔB阈值,该方法以0.65至0.99的ROC-AUC识别出偏见增加的模型检查点。在WildGuardMix和DecodingTrust上,它在三个模型系列中均优于基于SEAT的基线。该方法无需特定任务的评估数据,计算量也显著低于输出级审计,但其作用是补充而非取代后者。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。