确定性 PRM 引导为何在离散扩散推理中表现较差
一项针对离散扩散语言模型的研究发现,在相同的前向传递计算预算下,确定性过程奖励模型(PRM)引导不如更简单的方法:独立采样候选答案,再用结果奖励模型(ORM)重新排序。在 GSM8K 上,使用 8 个候选答案的 PRM 引导准确率为 65.18%,而 ORM 重新排序达到 75.13%;候选数增至 32 个时,差距扩大到 12.69 个百分点。研究人员指出两个问题:PRM 在去噪过程中的信号会减弱,可能过早淘汰有效解答;此外,PRM 有时也不擅长判断最终答案。不过在 MBPP 上,PRM 对已完成程序进行重新排序时,表现与 ORM 相当。团队还公开了带有结果标签的去噪状态数据集和评测工具。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。