LVMT:面向长时视频分割的视频掩码变换器
现有在线视频分割方法难以在存在长时间遮挡的复杂长视频中持续跟踪物体。LVMT采用轻量级GRU模块,学习选择需要随时间保留和传递的物体信息。其训练策略“截断查询传播”将视频分段处理,使模型能够学习更长时间跨度的信息,同时避免过高的内存需求和跨片段反向传播。研究团队称,在六项基准测试中,LVMT在多种视频分割任务上达到当时的最佳水平,速度比此前的领先方法快十倍。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。