TT-VidT 解耦时间轴,提升以运动为中心的视频预训练效率
TT-VidT 是一种自监督视频学习方法,旨在将帧的外观信息与运动信息分离。研究人员在约 1.7 亿至 1.9 亿参数规模的编码器上,对架构和训练目标进行了 24 种受控组合实验。该方法将逐帧处理的 ViT-B/16 空间路径与紧凑的时间迁移层结合起来,并根据首帧外观锚点和各帧特有的运动 token 重建目标帧。在微调测试中,TT-VidT 在 Jester、Something-Something V2、ARID 和 Diving48 上取得了比较方法中的最佳结果,同时使用的编码器 FLOPs 少于 DisMo、VideoMAE 和 V-JEPA2。不过,该方法并未在所有数据集上领先,因此其性能提升的普适性仍受到限制。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。