WorldReward:面向相机条件世界模型的奖励建模
WorldReward是一种基于视觉语言模型的奖励模型,用于评估相机条件世界模型。它将成对视频拆分为与动作对齐的片段,同时评估指令动作是否产生预期的场景变化,以及画面外观和运动质量。研究团队构建了经过推理增强的偏好数据集,并推出由人工标注的WorldReward-Bench,用于衡量模型在动作一致性、外观质量和运动质量方面与人类偏好的吻合度。论文称,WorldReward在三个维度上都取得了最高的人类偏好一致性;将其用于HY-WorldPlay 1.5的强化学习后训练后,还能在短期到长期时间范围内持续提升动作执行和视觉质量。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。