NaviDC-OCR:面向数字文档与相机拍摄文档的文档解析
NaviDC-OCR 是一个基于视觉语言模型的统一文档解析框架。该系统通过形变感知学习处理相机拍摄文档中的几何畸变,利用自适应采样表示复杂版面,并将内容与结构分开建模,包括公式语法和表格结构。研究团队表示,NaviDC-OCR 在多项文档解析基准测试中取得领先性能,在 OmniDocBench v1.6、Wild-OmniDocBench 和 PureDocBench 上分别获得 96.87、88.53 和 78.41 分,并在 ICDAR 2026 Sci-ImageMiner 挑战赛中排名第一。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。