原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.14075
立即前往原文

迈向通用科学人工智能:科学图像的多模态理解

科学图表和表格包含重要的实验依据,但数字图书馆和多模态人工智能系统仍难以检索和解读这些内容。ALD/E-ImageMiner基准和ICDAR 2026原子层沉积与蚀刻科学图表信息提取竞赛,收录了来自205篇出版物的1,951幅图表,并由专家完成标注。任务涵盖分类、表格数据提取、摘要生成和视觉问答。相关论文探讨如何评估视觉与定量阅读、基于领域知识的推理,以及利用证据进行论证的能力,并提出将“从图像理解科学概念”作为长期基准目标。未来方向包括扩展科学领域和图表类型、跨文档综合、假设评估、来源追踪、不确定性分析及反事实推理。
行业资讯 应用 研究 2026-08-17 17:30:49 228 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。