基于能力门控的语言模型与先验信息融合用于事件预测
该研究分析语言模型何时能在市场、群体或统计预测之外提供额外信息,而不是只比较模型自身的准确率。研究提出能力门控机制,根据已揭晓的结果估计不同领域的信息源权重,将不确定的估计值收缩至全局权重,并重新校准融合后的预测。在2,357个已确定结果的二元问题和5个语言模型上,该方法将主要外部基线的布里尔评分从0.0771降至0.0732。即使控制数据泄漏,并与时间序列先验进行比较,改进仍具有显著性。但在ForecastBench官方市场子集中,方法没有带来显著提升,主要原因是它大多沿用市场预测。4个Qwen模型的语言置信度无法可靠判断模型何时会超过外部预测,而基于结果估计的能力指标有助于改进弃权决策。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。