原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.23658
立即前往原文

视频扩散模型为何违反物理规律?研究揭示注意力机制缺陷

一项可解释性研究探讨了最先进的视频扩散模型为何在具备出色视觉质量的同时,仍经常生成不符合物理规律的运动。研究发现,运动轨迹在早期去噪阶段形成,并由一组特定的注意力头驱动。分析还表明,旋转位置编码(RoPE)会导致空间注意力过度衰减,使早期候选区域过早锁定在不合理的位置,抑制相邻帧中的合理运动轨迹。研究人员提出一种轻量级架构改动,根据不同去噪步骤调整RoPE频率,从而帮助模型探索更合适的候选区域。无需训练和经过训练的实验均显示,该方法能够提升生成视频的物理常识与运动一致性。
行业资讯 AI模型 研究 2026-09-22 11:01:30 707 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。