根据公开资料,卡迪夫大学和墨尔本大学的一项新研究发现,生成式人工智能(GenAI)目前还无法像人类教师一样可靠地评判学生的书面作业。这项研究的结论明确指出,至少在现阶段,即使经过大量训练,AI模型也难以对主观性较强的书面作业给出与人类相当的分数。
本次研究的具体操作涉及使用ChatGPT的两个版本,对共计50篇生物科学专业本科生论文进行了评分。为了模拟真实的学术评估场景,研究人员要求ChatGPT按照7项标准批改这些论文,并且采用了4种不同的提示方式来测试AI的能力。
在实际的评分对比中,卡迪夫大学生物科学学院威廉·凯博士观察到生成式AI与人类批改同一批论文时存在明显差异。这种差异体现在量化指标上:AI模型与人工评分的最大差距在平均分方面达到了16.1分;而在单篇论文的评分上,最大差距甚至可以达到40分。
威廉·凯博士进一步分析了AI评分模式的问题,指出AI往往会压低高分论文的成绩,同时又会将低分作业的成绩抬高,最终导致整个分数系统性地向中间集中,这与人类教师的评估习惯存在偏差。
从高等教育领域的背景来看,学术界关注大模型是否能利用模式识别能力来让学生作业评分更客观、提高批改效率并减轻教职人员压力。然而,卡迪夫大学和墨尔本大学的研究结果表明,目前AI在这一应用场景中尚不适合替代人类教师的评估工作。
威廉·凯博士基于研究结果做出了明确的建议,他指出大模型不能、也不应该被依赖来给学生的长篇书面作业评分。这强调了学术评价过程中主观判断和细微理解的重要性,这是当前AI技术尚未完全掌握的能力。
时间线上的关键点在于,这项研究提供了一个具体的实证案例——生物科学本科论文的批改过程,用以检验GenAI在处理需要一定人文或专业深度判断的任务时的局限性。这为教育科技领域对AI应用提供了重要的参考基准。
影响分析方面,该研究提醒高等教育机构和技术开发者,虽然AI在提高效率上有潜力,但在涉及核心学术评价的环节,必须保持审慎的态度,不能盲目依赖自动化评分系统来替代专业教师的判断力。这要求未来AI辅助教学工具的设计必须将“可信度”置于首位考量。
读者提示:对于关注教育技术发展的读者而言,理解这种“可靠性差距”至关重要。它意味着当前阶段,AI更适合作为辅助工具进行初步筛选或提供反馈建议,而非最终的、决定性的评分依据。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。