原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.00531
立即前往原文

科学还是劣质生成内容?评估并减少 AI 生成论文中的科学缺陷

这项研究分析了基于 token 的检测器难以发现的 AI 生成科学论文缺陷:各部分看似合理,但连接它们的科学推理可能存在断裂。研究团队提出六项衡量指标,并构建 SciSlopBench,收录 390 篇 AI 生成论文,每篇都配有研究问题和贡献类型相近的人类撰写论文。这些指标在 85.9% 的配对中识别出 AI 论文,高于 Binoculars 的 68.7%。科学缺陷越多,ICLR 评分往往越低。研究提出的 SciSlopHarness依据实验结果指导针对性修改;与最强的现有修改基线相比,它将 AI 论文与人类论文之间剩余的差距缩小了 63%。
行业资讯 伦理与安全 研究 2026-10-05 11:01:01 900 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。