MoTE:面向多任务视频理解的任务专家混合架构
MoTE是一种面向视频语言模型的解码器架构,将大语言模型的前馈网络转化为面向不同任务的专家,同时共享多模态骨干网络。与令牌级路由不同,每个样本根据任务采用明确的路由,因此实际计算量不受存储专家数量影响。在五项COIN基准测试中,VideoLLM-MoTE每个样本激活约20亿个语言模型参数,平均Top-1准确率高于近期VideoLLM基线模型。在相同专家结构下,它还优于密集激活所有专家和学习式稀疏路由方法,表明任务结构化路由可为多任务视频语言学习提供更易解释且更高效的计算方案。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。