先前问题中的计算能帮助大语言模型解决新问题吗?
一项研究考察先前问题是否会影响大语言模型在后续问题上的准确率。实验表明,即使在同一领域,对话历史也可能提升或降低模型表现。研究人员提出 STAIR,将先前生成回答时的键和值存入固定存储库,并训练模型在处理提示时引导当前查询读取该存储库。基础模型保持冻结,仅训练 12,288 个参数。在三种 Qwen 模型和四项基准测试中,与使用对话历史的未修改模型相比,STAIR 将后续轮次的准确率最高提高了 11.67 个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。