原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.10060
立即前往原文

利用隐藏状态相对表示检测大语言模型偏见

一项研究提出了一种基于参照的偏见审计方法,通过分析大语言模型的隐藏状态表示来检测偏见。该方法根据句子与固定锚点句集合的相似度对句子进行编码,使微调前后的模型变体即使内部表示结构发生变化,也能在统一的比较空间中进行分析。研究者提出“表示偏见变化”指标ΔB,用于衡量目标群体与正面、负面属性之间关联的变化。在三个模型系列的18种测试设置中,ΔB有15次与输出层面的偏见变化相关,最高相关系数为|r| = 0.84。通过设置ΔB阈值,该方法以0.65至0.99的ROC-AUC识别出偏见增加的模型检查点。在WildGuardMix和DecodingTrust上,它在三个模型系列中均优于基于SEAT的基线。该方法无需特定任务的评估数据,计算量也显著低于输出级审计,但其作用是补充而非取代后者。
行业资讯 伦理与安全 AI模型 研究 2026-09-10 17:30:58 882 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。