原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.10429
立即前往原文

SGF+:解耦自回归视频生成中的梯度流

自回归视频生成需要对当前帧进行去噪,同时将其键值表示写入上下文,以供未来预测使用。由于这两种功能通常共享参数,其梯度可能相互冲突。SGF+为上下文写入和去噪分配独立参数,同时通过因果注意力保留两者的交互。该方法使用原有生成目标联合优化,不引入辅助损失。在评估的逐帧和分块生成设置中,它提升了视觉质量与时间一致性,且不需要额外视频数据或更长的训练时间。研究者报告称,仅用五秒生成序列训练的模型,无需针对长视频微调即可连续生成最长达24小时的视频。
行业资讯 AI模型 研究 2026-10-08 11:01:02 753 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。