还有哪些地方需要修正?探索对话生成产物中修订传播的高性价比测试时计算
该研究考察大型语言模型能否将用户提出的局部修改传播到通过对话生成的产物中所有受影响的依赖部分。研究人员提出了一个新基准,并使用 gpt-oss-20b/120b、gpt-5.4-mini 以及 qwen3.5-9b/27b/122b 评估了九种修订方法,包括顺序反思和并行采样。基线方法的准确率为 68.3% 至 93%。最具成本效益的方法是从三个并行样本中,使用基于大语言模型的选择器或 medoid 选择法挑选结果,使准确率提高 2.2 至 9.7 个百分点。代码和数据集已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。