GRACE:面向高效视频生成的生成感知潜变量压缩
GRACE是一种两阶段方法,可压缩预训练视频自编码器,同时保持其与预训练扩散Transformer(DiT)的兼容性。该方法将原始潜变量保留为冻结的基础表示,并加入残差潜变量来补充更高压缩率造成的信息损失,同时将压缩表示对齐到冻结DiT的特征空间。随后通过轻量微调和非对称去噪调整DiT。在Wan2.1-I2V-14B上,GRACE在480 × 832 × 81设置下将token数量减少至八分之一、延迟降低至原来的1/11.1,并在VBench上达到与压缩前流程相当的生成质量。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。