基于脚本感知混合专家的全能多语言场景文字识别
研究人员提出了ScriptMoE,这是一种覆盖10种文字体系、229种语言的场景文字识别模型。该模型采用共享视觉编码器和稀疏混合专家解码器,将每张图像路由至与其文字体系匹配的专家,同时通过共享专家学习跨文字体系知识。研究团队还构建了合成数据集TextMuSS-10M,以弥补许多语言训练数据不足的问题。ScriptMoE在TextMuSS-Bench上达到82.06%的准确率,比最强基线高1.31个百分点。在CC-OCR端到端任务中,仅替换PP-OCRv5的识别器,就将F1分数从65.71%提升至80.89%,略高于评测中表现最佳的视觉语言模型。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。