扩散奖励模型
研究人员提出了DRM,一种用于大语言模型对齐的扩散奖励模型。传统方法通常将每个提示—回答对压缩为单点估计,或假设输出属于固定的参数分布;DRM则对可能奖励的条件分布进行建模。轻量级扩散Transformer从噪声中生成奖励向量,能够表示人类偏好的多峰结构。该架构同时支持多属性回归和成对偏好数据。在五项基准测试中,DRM以相对有限的训练规模达到或超过基线方法。基于不确定性的拒绝策略以及分位数聚合,可利用超越单一标量奖励的信息来改进决策。在下游RLHF实验中,将DRM用作训练奖励也提升了策略性能,显示出扩散式奖励建模的实际价值。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。