去噪增偏:通过闭环激活引导向扩散语言模型注入定向偏见
一项研究发现,在迭代去噪过程中,可以将扩散语言模型引导至偏向特定人口群体的回答。攻击者使用比例-积分(PI)控制器跟踪目标答案的概率,并动态调整引导向量。在BBQ的模糊问题上,LLaDA-8B-Instruct对目标群体的偏好提高了1.8至16.7个百分点;在SocialStigmaQA上,污名化回答的比例从17.6%升至58.1%。研究指出,生成过程中的内部激活可能成为攻击途径,因此偏见审计还应检查模型的服务与部署流程,而不应只关注模型本身。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。