原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.22947
立即前往原文

RewardVerse:面向视频奖励模型的准则引导策略优化

RewardVerse旨在缓解视频奖励模型的评分不稳定问题。当模型将主观的视频质量直接映射为单一分数时,评分尺度可能随提示而漂移。该框架先生成适应具体查询的动态评估准则,再据此进行评分。两阶段训练算法RGPO先用不断演进的种子准则预热评分器,随后联合优化准则生成器和评分器。研究团队称,在16维EvalVerse基准和外部数据集上的实验显示,该方法能够减轻评分尺度漂移,并在单项评估和成对评估中取得较好表现。其目标是为视频生成中的强化学习提供更稳定、可解释的奖励信号。
行业资讯 AI模型 研究 2026-09-24 11:01:31 174 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。