定位视频中的任意目标:重新思考高效生成式时空视频定位
研究人员提出了 Parallel Tube Decoding(PTD),用于更高效地定位视频中被指代的事件和目标。不同于通过自回归方式逐帧生成密集轨迹,PTD 将时间定位与空间定位分离,并行解码空间模块。因此,无论轨迹长度如何,顺序解码深度都固定为两轮。在 VidSTG 基准测试中,PTD 相比标准自回归解码将完整轨迹的完成延迟降低了 79 倍,并将空间解码吞吐量提升了 92 倍,同时提高了定位准确率。一个仅有 40 亿参数的模型在 VidSTG 和 HC-STVG 上取得了有竞争力的表现,并能零样本迁移到其他视频理解任务。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。