原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.37200
立即前往原文

Adaptive Reward Routing:通过前向过程强化学习动态优化音视频联合扩散的多重奖励

该研究提出 Adaptive Reward Routing,利用前向过程强化学习(DiffusionNFT)改进音视频联合扩散模型。该方法动态调整模型中进行更新的位置,以及多种奖励的协调方式。它通过双向交叉注意力响应估计音频与视频之间影响力的变化,并据此调整面向 token 的损失和梯度。此外,方法将预设奖励权重保留为偏好先验,并在预热阶段后根据各分支的梯度交互进行修正。实验结果显示,与有竞争力的强化学习基线相比,该方法在模态质量、语义一致性和音视频同步方面均有所提升。
行业资讯 研究 2026-10-02 12:01:05 344 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。