原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.35457
立即前往原文

距离移除视觉编码器还有多远?无编码器多模态预训练的缩放定律

一项研究比较了使用预训练视觉编码器的多模态大语言模型,与直接从原始像素学习视觉表征的无编码器模型的缩放特性。无编码器模型在较小规模下表现较差,但研究预测其可能在约 10^22 FLOPs 时追上传统架构。在多模态目标上,最优计算分配会转向更大的模型,而文本目标的缩放趋势基本不变。随着训练计算量增加,语言模型逐渐承担视觉编码器的功能:视觉 token 之间的双向交互变得更有益,视觉处理转向更早的层,专家路由也更加集中于视觉 token。研究结果表明,预训练视觉先验的优势会随着模型规模扩大而减弱,无编码器架构因此成为多模态预训练的一个可行研究方向。
行业资讯 AI模型 研究 2026-09-29 15:01:09 807 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。