原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.14302
立即前往原文

E2A-Bench评估金融图表推理中的证据到行动可靠性

E2A-Bench是一个包含969个查询的基准测试,用于评估视觉语言模型能否将金融图表证据可靠地转化为行动建议。该基准覆盖HS300指数的323家成分股,并使用从OHLCV数据中确定性生成的证据锚点。评估指标包括依据性、推理与行动的一致性、置信度校准和方向覆盖率。对20个视觉语言模型的测试发现,单一的幻觉评分会掩盖一些问题:方向覆盖率过低可能导致模型排名靠后;预言机辅助验证虽然能减少无依据的陈述,也可能降低覆盖率;金融领域微调还使测试模型的BUY:SELL比例提高了4.21至4.68倍。该基准评估的是从证据到行动这一完整链条的可靠性,而不是实际交易表现。代码和数据已公开。
行业资讯 应用 AI模型 研究 开源 2026-09-15 22:00:59 378 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。