具备简易适应能力的流式视频编辑
论文提出了SVEET,一个通过适配预训练双向视频扩散模型实现高质量流式视频编辑的框架。该方法基于骨干特征解耦和条件帧独立性,支持自回归式编辑。辅助模型分支使用时间独立的自注意力编码源视频,并将中间特征注入骨干网络的对应模块。此外,解耦训练方案将视频可控性与模型因果性的优化目标分开,从而支持在不同骨干架构之间进行零样本迁移。实验显示,SVEET无需额外加速技术,即可在单张H100 GPU上达到每秒15帧。代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。