一个编辑器,多种编辑:面向多样化视频编辑的统一免训练框架
EditVid 是一个支持指令引导和参考引导视频编辑的免训练框架。它结合稀疏因果记忆以保持局部时序一致性,利用基于对应关系的注意力后令牌注入来维持长距离身份特征,并通过软潜变量融合限制编辑范围。该框架支持风格迁移、属性修改、对象插入、部件级编辑和主体替换。在 FiVE 上,EditVid 的 FiVE-Acc 达到 78.16,高于评测中最强免训练基线的 58.95;在 IVEBench 上也取得了具有竞争力的结果。用户研究显示,51.8%的参与者更偏好 EditVid,而不是七种对比方法。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。