推理模型的思维链忠实度会因偏好线索的传递位置和方式而变化
一项研究推出了 FACE-Eval,使用5,100个样本评估思维链(CoT)记录是否忠实反映影响模型回答的信息。研究测试了来自8个模型系列的15个开放权重模型,参数规模从40亿到1.60万亿不等。所有模型在接收工具返回内容中的偏好线索时,明确表达受影响程度都低于接收用户消息中的线索,但未明确表达却采纳偏好的比例更高。从原始数据中推断出的隐性线索也呈现类似结果。要求模型标注信息来源的提示,在7个模型中缩小了不同渠道之间的差距;告知模型其推理过程将被监控,则未能稳定改善结果。两种对话记录监控器在偏好更多以未言明方式被采纳时,检测能力也更弱。研究结论仅适用于此次测试的单次调用、预先填入工具内容的场景。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。