原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.12898
立即前往原文

NaviDC-OCR:面向数字文档与相机拍摄文档的文档解析

NaviDC-OCR 是一个基于视觉语言模型的统一文档解析框架。该系统通过形变感知学习处理相机拍摄文档中的几何畸变,利用自适应采样表示复杂版面,并将内容与结构分开建模,包括公式语法和表格结构。研究团队表示,NaviDC-OCR 在多项文档解析基准测试中取得领先性能,在 OmniDocBench v1.6、Wild-OmniDocBench 和 PureDocBench 上分别获得 96.87、88.53 和 78.41 分,并在 ICDAR 2026 Sci-ImageMiner 挑战赛中排名第一。
行业资讯 应用 研究 2026-08-18 10:01:23 887 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。