InSight-doc:面向长文档理解的智能体视觉感知
InSight-doc 是一个用于理解视觉内容丰富的长文档的智能体框架。系统从低分辨率开始处理,仅对需要更详细证据的相关区域进行选择性放大,并且不依赖外部检索器。其训练数据包括17,900条带有区域级缩放轨迹的高质量监督微调样本,以及19,200条高难度强化学习样本。InSight-doc-8B在文档视觉问答基准上的准确率较基线提升4.3至16.4个百分点。在长文档场景中,该系统在保持准确率优势的同时,将幻觉减少超过40%,将推理延迟降低41%至68%。代码、数据集和模型均已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。