VA-Judger:基于人类偏好的视频音频联合生成奖励建模
VA-Judger是一种用于视频音频联合生成的奖励模型,旨在比单独评估音频质量、视觉保真度和同步性的传统指标更准确地反映人类偏好。研究团队构建了包含9,000个提示词和10,300组细粒度成对比较的VAPref-10K数据集,并提出VA-Judger-Bench评测基准。该模型逐步学习结构化的偏好解释,并通过按质量维度分解人类反馈的强化学习来提供更密集的奖励信号。实验表明,VA-Judger在域内和域外评估中都比现有指标更能预测人类偏好。利用其奖励信号对视频音频生成模型进行后训练,也能提升生成质量。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。