UniSwap:面向说话视频的流式音视频身份替换
UniSwap是一种用于流式替换说话视频中人物外貌和声音的框架。系统输入参考图像与参考语音,通过单一音视频扩散Transformer迁移视觉身份和声音音色,同时保留原始动作、场景、语言内容以及音画同步。针对跨身份配对训练数据稀缺的问题,研究人员提出了交换与重建训练流程。流式适配、KV缓存和高效扩散技术将每个区块的去噪步骤从30步减少到3步。实验结果显示,该方法具备较好的音画同步、具有竞争力的身份保持能力,以及稳定的长视频生成表现。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。