原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.24058
立即前往原文

基于脚本感知混合专家的全能多语言场景文字识别

研究人员提出了ScriptMoE,这是一种覆盖10种文字体系、229种语言的场景文字识别模型。该模型采用共享视觉编码器和稀疏混合专家解码器,将每张图像路由至与其文字体系匹配的专家,同时通过共享专家学习跨文字体系知识。研究团队还构建了合成数据集TextMuSS-10M,以弥补许多语言训练数据不足的问题。ScriptMoE在TextMuSS-Bench上达到82.06%的准确率,比最强基线高1.31个百分点。在CC-OCR端到端任务中,仅替换PP-OCRv5的识别器,就将F1分数从65.71%提升至80.89%,略高于评测中表现最佳的视觉语言模型。
行业资讯 应用 AI模型 研究 2026-09-23 12:01:33 203 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。