ActReview:基于反驳引导的训练数据与评分类别奖励,生成可执行的同行评审
该研究探讨如何让大语言模型生成不仅能发现问题,还能指导作者进行具体修改的同行评审。ActReview将任务拆分为问题诊断和修改建议生成。研究人员利用OpenReview上的真实评审与反驳讨论,构建ActReview-40K数据集,将评审者提出的问题与作者回应及论文中的证据对应起来。Qwen3-8B-Base先经过监督微调,再使用GRPO和针对具体问题的评分类别奖励进行后训练。研究还推出了由人工整理、包含1,000个案例的ActReview-Bench。实验显示,该方法在建议的可执行性和证据支撑方面优于以往专用模型,但技术准确性仍存在不足。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。