原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.17402
立即前往原文

MoE-ViE:用于高效图像和视频理解的混合专家视觉编码器

该研究探讨了用于扩展 CLIP 类视觉编码器的混合专家架构。研究人员发现,细粒度专家拓扑结构的表现优于密集模型和标准 MoE 架构。论文还提出了一种无需辅助损失的专家均衡方法,以及用于降低推理延迟开销的专用 MoE 内核。为提升视频能力并保留图像知识,研究采用了帧级蒸馏和一种新的冻结机制。研究团队预训练了多个规模的 MoE-ViE 模型,均稳定超过对应的密集模型。最大模型以相当于其 76% 的延迟,达到规模为其 1.7 倍的先进编码器的零样本性能。与大语言模型对齐后,MoE-ViE 在图像和视频基准测试中超过所有对比编码器,其中包括激活参数多达其五倍的模型。代码已在 GitHub 开源。
行业资讯 AI模型 研究 开源 2026-08-19 16:01:24 739 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。