原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.11994
立即前往原文

通过主张级可靠性评估提升测试时推理效率

研究提出了主张级可靠性评估(Claim-Level Reliability Assessment,CLR),这是一种无需额外训练、旨在更高效利用推理时计算资源的方法。CLR不再生成更多完整解答,而是从推理轨迹中提取对决策至关重要的主张,并针对性地检查其中是否存在决定性错误。该方法利用了一个不对称性:构建正确解答需要一条完全无误的推理路径,而反驳错误主张只需找到一个决定性缺陷。在四个大语言模型和四个推理基准上的测试中,CLR总体上优于pass@1和自洽性方法。在GPT-OSS-20B/CMIMC25上,CLR比pass@1高出27.15个百分点,将自洽性准确率从77.50%提升至82.19%,同时减少了37.0%的token使用量。
行业资讯 AI模型 研究 2026-08-17 11:02:25 947 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。