一张被污染的网页就够了:评估 LLM 推荐系统中的网络内容污染
带搜索功能的 LLM 越来越多地利用实时网络内容进行商品推荐,因此可能被经过操纵的网页误导,成为虚假商品的无意推广者。研究团队推出 FORGE 基准测试,将检索网页中的真实商品替换为虚假商品,以评估模型的脆弱性。研究覆盖 225 件商品、15 个类别、5 种消费场景,以及 12 个商业和开放权重模型。结果显示,所有模型都存在漏洞:仅一张被污染的网页就能使虚假推荐率最高达到 27%;将排名前三的网页全部替换后,该比例升至 73.8%。推理能力无法缓解这一问题,反而经常生成虚假的社会认同证据,为错误推荐提供理由。测试的四种防御措施均不够有效;按可信度重新排序虽能改善所有模型,但只能移除约六分之一的虚假推荐。FORGE 基准测试和评估代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。