原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.05416
立即前往原文

Prism:用于原生 2K 音视频联合生成模型训练的动态稀疏注意力

Prism 是一种动态稀疏注意力方法,用于以原生方式训练 2K 分辨率的音视频联合生成模型。它将序列划分为时空宏观区域,并根据局部视觉特征以及音视频耦合强度调整区块形状。混合选择策略还会为每个查询动态选择注意力区块。作者的实验显示,与完整注意力相比,Prism 将训练速度提高了 2.5 倍,同时生成质量更高。
行业资讯 AI模型 研究 2026-10-06 10:31:24 769 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。