构建可信AI审稿系统的关键一环:从修辞稳健性评测到SciCore Review
AI审稿系统可能因措辞不同而对科学内容相同的稿件给出不同判断。该研究将修辞稳健性定义为两项要求:面对保留内容的改写时评价保持稳定,同时能够区分不同论文。研究团队推出受控基准RobustReview,包含1,260个稿件版本,并评估了30种审稿配置。结果显示,对改写不敏感并不一定代表真正稳健;如果不同论文的分数也趋于一致,就会形成“虚假稳健”。SciCore将全文评审与基于抽取出的结构化科学核心所作的评审结合起来。在与GPT-5.5的主要对比中,SciCore在稳定性和区分能力的综合表现上处于领先水平,同时与人类判断保持了有竞争力的一致性。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。