原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.01657
立即前往原文

NeoMME:用于高效微调与推理的单塔式多模态原生多语言基础编码器

研究人员推出 NeoMME,这是一个包含 2.6 亿和 8 亿参数模型的双向多模态、多语言编码器系列。模型在单一 Transformer 编码器中处理多语言文本和原始图像块,并支持 16,384 个 Token 的上下文长度。在 ViDoRe v3 文档检索基准测试中,NeoMME Retriever 的 nDCG@10 分别达到 0.523 和 0.556。在 NVIDIA L40S 上使用 2048×2048 图像输入时,260M 模型的页面编码吞吐量约为 ColModernVBERT 的两倍。通过分层 Token 池化和非对称量化,多模态文档嵌入可压缩 255 倍,同时保留超过基线 nDCG@10 的 95%。预训练骨干模型和检索兼容检查点已通过 Hugging Face 按 Apache 2.0 许可证发布。
行业资讯 应用 AI模型 研究 开源 2026-09-03 22:01:26 914 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。