原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.05894
立即前往原文

去噪增偏:通过闭环激活引导向扩散语言模型注入定向偏见

一项研究发现,在迭代去噪过程中,可以将扩散语言模型引导至偏向特定人口群体的回答。攻击者使用比例-积分(PI)控制器跟踪目标答案的概率,并动态调整引导向量。在BBQ的模糊问题上,LLaDA-8B-Instruct对目标群体的偏好提高了1.8至16.7个百分点;在SocialStigmaQA上,污名化回答的比例从17.6%升至58.1%。研究指出,生成过程中的内部激活可能成为攻击途径,因此偏见审计还应检查模型的服务与部署流程,而不应只关注模型本身。
行业资讯 伦理与安全 研究 2026-10-06 13:01:02 509 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。