SGF+:解耦自回归视频生成中的梯度流
自回归视频生成需要对当前帧进行去噪,同时将其键值表示写入上下文,以供未来预测使用。由于这两种功能通常共享参数,其梯度可能相互冲突。SGF+为上下文写入和去噪分配独立参数,同时通过因果注意力保留两者的交互。该方法使用原有生成目标联合优化,不引入辅助损失。在评估的逐帧和分块生成设置中,它提升了视觉质量与时间一致性,且不需要额外视频数据或更长的训练时间。研究者报告称,仅用五秒生成序列训练的模型,无需针对长视频微调即可连续生成最长达24小时的视频。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。