原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.33419
立即前往原文

TT-VidT 解耦时间轴,提升以运动为中心的视频预训练效率

TT-VidT 是一种自监督视频学习方法,旨在将帧的外观信息与运动信息分离。研究人员在约 1.7 亿至 1.9 亿参数规模的编码器上,对架构和训练目标进行了 24 种受控组合实验。该方法将逐帧处理的 ViT-B/16 空间路径与紧凑的时间迁移层结合起来,并根据首帧外观锚点和各帧特有的运动 token 重建目标帧。在微调测试中,TT-VidT 在 Jester、Something-Something V2、ARID 和 Diving48 上取得了比较方法中的最佳结果,同时使用的编码器 FLOPs 少于 DisMo、VideoMAE 和 V-JEPA2。不过,该方法并未在所有数据集上领先,因此其性能提升的普适性仍受到限制。
行业资讯 AI模型 研究 2026-09-29 14:30:58 206 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。