原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.24220
立即前往原文

Document Retrieval-Aware Chunking(D-RAC):面向企业文档的通用检索感知式摄取

D-RAC是一种面向检索增强生成(RAG)系统的文档摄取方法,可处理PDF、办公文档、演示文稿和扫描件。该方法首先将输入文档标准化为PDF,再通过一次多模态大语言模型处理,将页面转换为适合检索的Markdown,同时保留标题层级,并将表格改写为可独立理解的文字陈述。随后,系统基于可寻址的标识符进行确定性分块,无需重新生成源文本。在包含236份文档、795页内容的基准数据集上,D-RAC在72分钟内无错误完成处理,生成1,748个可检索分块。与代理式分块相比,其输出Token减少95.7%,成本降低77.8%至85.6%,处理时间缩短75%。
行业资讯 应用 研究 2026-09-22 15:30:59 440 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。