音视频模型中的注意力三角
该研究分析音视频扩散模型如何通过三条跨模态注意力路径协调文本、声音和视觉内容。研究发现,音频与视频之间的路径具有双向作用:音频可以影响视频生成,视频也可以影响音频生成。模型参数中学习到的偏差可能使这些交互覆盖原本的条件输入,从而生成视觉上典型但语义错误的结果。研究人员从注意力模式中提取信号,用于诊断语义如何在不同模态之间分布,并在推理阶段实施受控干预。实验表明,该方法能够改善跨模态语义对齐,同时基本保持生成质量。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。