卡迪夫大学研究:AI目前仍无法像人类教师一样可靠地批改作业
卡迪夫大学和墨尔本大学的一项研究发现,生成式人工智能目前还无法像人类教师一样可靠地评估学生的书面作业。研究人员使用两个版本的 ChatGPT,按照 7 项标准和 4 种提示方式,为 50 篇生物科学专业本科生论文评分。虽然 AI 与人工评分的总体平均分较为接近,但在具体评分标准和单篇论文上存在明显差异。平均分的最大差距为 16.1 分,单篇论文的差距则达到 40 分。AI 还倾向于压低高分论文的成绩、抬高低分作业的成绩,使分数系统性地向中间集中。研究人员表示,目前的大型语言模型不适合取代教师或预测学生作业成绩。未经学生明确同意就将作业提交给 AI 工具,也会带来伦理问题。
本文来源:IT之家,仅供学习参考,版权归原作者所有。