所有模态一律平等,但视频更平等:弥合联合视频生成中的交叉注意力差距
研究发现,联合多模态扩散 Transformer 存在一种不对称性:音频或 3D 身体动作等伴随模态与视频的对应关系较强,但它们对视频生成的约束作用明显较弱。研究团队提出 RecCAR,即互惠跨模态注意力正则化,通过 KL 正则项,让较弱的“模态到视频”对应关系向较强的“视频到模态”对应关系靠拢。在视频-动作和视频-音频联合生成任务中,人体解剖评分从 0.69 提升至 0.75,音视频不同步程度则从 0.804 降至 0.752。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。