FrameMorrow利用面向未来的Token选择长时段视频生成所需帧
FrameMorrow是一种用于长时段视频生成的历史帧选择方法。它不再只根据当前内容判断历史信息是否相关,而是预测一组代表未来信息需求的少量“前瞻Token”,并利用这些Token从生成历史中筛选有用帧,从而减少冗余上下文。由于该方法处理显式视频帧,而不是特定模型的内部状态,因此可以较低的额外推理成本集成到不同生成器中,包括闭源模型。在五个基准测试和11个生成模型上的评估显示,FrameMorrow能够改善长程一致性、视觉质量和动作对齐效果。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。