生成式人工智能(GenAI)正在以惊人的速度渗透到各行各业,教育领域也不例外。从自动生成教案到个性化学习辅导,AI技术似乎无所不能。然而,最新的一则AI新闻却给这股热潮泼了一盆冷水:卡迪夫大学和墨尔本大学联合研究发现,目前最先进的大模型在批改学生书面作业时,其表现远不如人类教师可靠。这项研究不仅揭示了AI技术在教育评估中的短板,更引发了关于“科技产品”到底能在多大程度上介入教育核心环节的深刻讨论。

研究设计:一场严谨的“AI阅卷”实验

为了精准评估AI的批改能力,研究团队设计了一套严谨的实验方案。他们选取了50篇生物科学专业本科生的真实论文作为测试样本,这些论文涵盖从细胞生物学到生态学的多个细分领域,具有典型的学术写作特征。实验使用了ChatGPT的两个版本(GPT-3.5和GPT-4),要求模型按照7项具体的评分标准进行批改,包括论点清晰度、论据充分性、逻辑连贯性、文献引用准确性、语言表达规范性等。

为了排除提示词偏差对结果的影响,研究人员还设计了4种不同的提示方式。比如,有的提示词要求模型“像一位严格的教授一样打分”,有的则要求“按照学术期刊的审稿标准进行评估”。随后,他们将AI给出的分数与三位资深人类教师独立评分的平均值进行对比,并重点分析了分数波动幅度和一致性。这种多维度对比的方法,使得实验结果具有较高的可信度。

值得注意的是,实验过程中所有论文均去除了学生个人信息,以确保隐私保护。但研究人员也强调,这并不能完全解决伦理问题——因为将学生作业未经同意提交给第三方AI平台本身就可能涉及数据泄露风险。这一实验设计本身也折射出当前教育领域引入AI技术时面临的复杂平衡:既要追求效率,又必须守住伦理底线。

核心发现:AI评分“忽高忽低”,系统性偏差明显

实验结果令人震惊。研究团队负责人威廉·凯博士指出:“AI模型给出的分数波动极大,根本无法准确预测人工评分。”具体数据显示,在平均分方面,AI与人类教师的差距最大达到了16.1分(百分制);而针对单篇论文,最大差距竟然高达40分。这意味着同一篇论文,AI可能给出及格分,而人类教师却认为它接近满分,反之亦然。

更令人担忧的是,AI表现出了明显的系统性偏差。研究特别指出,AI往往会压低高分论文的成绩,同时抬高低分作业的分数,最终使所有分数向中间区域集中。这种“趋中效应”导致优秀学生的努力无法被充分认可,而表现较差的学生则可能被虚假的高分所误导,失去改进的方向。

除了总分偏差,AI在每项具体评分标准上的表现也不稳定。例如,在“论据充分性”这一维度上,AI有时会过分关注字面数量而非论证质量,导致引用大量无关文献的论文获得高分;而在“逻辑连贯性”上,AI又容易受到复杂句式的干扰,把结构清晰的论文误判为混乱。这些发现表明,当前的大模型训练方法在理解主观性、语境化的学术写作时,仍然存在根本性的瓶颈。

技术瓶颈:为什么AI无法理解“主观性”?

要理解AI批改作业的失败,需要深入剖析大模型的工作原理。当前主流的生成式AI,包括ChatGPT在内,本质上都是基于海量文本数据训练的统计语言模型。它们擅长模式识别——比如识别出“首先……其次……最后”这样的结构,或者判断句子是否包含专业术语。但面对需要深层理解、价值判断和创造性思维的主观性作业时,模型的局限性就暴露无遗。

一个关键问题是:AI缺乏真正的“理解”。它不知道学生的论证是否具有原创性,也无法判断某个类比是否恰当。它只能通过训练数据中学到的统计规律来“猜测”分数。例如,如果训练数据中大多数高分论文都包含“然而”“因此”等转折词,AI就可能给包含这些词的论文加分,而不管其逻辑是否成立。这种“投机取巧”的评分方式,在涉及复杂认知任务的AI Agent技术中同样存在,但在教育场景中尤其危险。

此外,AI对提示词的敏感性也暴露了其脆弱性。实验中,仅仅改变提示方式,AI的评分结果就出现显著差异。这种不稳定性直接挑战了“AI评分客观”的假设。相比之下,人类教师经过专业培训,能够基于共同的教学目标和评分标准保持一致性,同时还能根据学生的个体差异进行灵活调整。这种“人性化”的判断能力,是当前任何AI技术都无法替代的。

有趣的是,AI在另一些领域却表现出惊人的能力。比如,利用AI画图生成的图像已经达到以假乱真的程度,文生图技术更是让创意设计变得触手可及。但文本评估与图像生成本质上是不同的认知任务:前者需要深度推理和主观评价,后者更多是模式匹配和风格模仿。这种对比恰恰说明,AI技术的进步并非线性全面,而是呈现出明显的“偏科”特征。

伦理与隐私:学生作业成了AI的“饲料”?

除了技术层面的争议,这项研究还引发了关于教育伦理和数据隐私的深刻反思。研究中提到,未经学生明确同意就将作业提交给AI工具,本身就涉及严重的伦理问题。现实中,不少教育机构已经在尝试使用AI批改平台,但往往忽略了学生的知情权和选择权。

更为隐蔽的风险在于,当学生作业被上传到云端服务器后,这些数据很可能被用于进一步的模型训练。从某种意义上说,学生成了免费的人工智能训练数据提供者,而他们的学术成果却可能被商业化利用。这种“数据殖民”现象在AI工具导航网站上推荐的诸多免费工具中同样存在,但教育场景的敏感性使得这一问题格外突出。

此外,AI批改还可能加剧教育不公。如果模型训练数据主要来自英语母语国家的学术写作,那么非英语母语学生的作业就可能被不公正地评分。这种偏见来自训练数据本身的偏差,而非模型故意为之,但其危害性同样不容忽视。教育公平是AI技术在教育领域落地时必须跨越的“红线”,而目前AI工具箱中提供的各类评分工具,大多尚未充分解决这一问题。

行业影响:教育科技产品的“信任危机”

这项研究对教育科技行业产生了直接冲击。近年来,多家公司推出了基于AI的自动批改系统,声称能大幅减轻教师负担,提高评分效率。然而,卡迪夫大学的研究表明,至少在主观性书面作业领域,这些产品目前的可靠性远未达到商业化应用的标准。

对于教育科技产品开发者而言,这意味着需要重新审视AI技术的应用边界。客观题、标准化测试或许可以放心交给AI,但涉及批判性思维、创造性表达和深度分析的任务,仍应保留人类教师的判断权。事实上,一些领先的教育科技公司已经开始调整策略,将AI定位为“辅助工具”而非“替代者”——比如先用AI进行初步筛查,再由教师进行复核和调整。这种“人机协作”模式可能是更现实的方向。

从更宏观的视角看,这一研究也为企业数字化转型中的AI应用提供了警示:技术并非万能,越是依赖人类主观判断的领域,AI的部署就越需要谨慎。教育行业作为培养未来人才的基石,不能为了追求效率而牺牲质量。正如研究人员所言:“随着大模型继续发展,未来模仿人类判断的能力可能会提高。但从这项研究来看,要让AI给出的分数与人工评分真正保持一致,恐怕并不容易。”

未来展望:AI教育之路该怎么走?

尽管当前结果令人失望,但研究者并没有否定AI在教育中的价值。他们指出,AI在特定场景下仍然可以发挥积极作用,比如辅助教师进行初步的格式检查、查重检测,或者为低年级学生提供即时反馈。关键在于明确AI的能力边界,并设计合理的“人机协作”流程。

未来的研究方向可能包括:开发更精细化的评分模型,使其能够识别不同学科的写作风格;引入多模态信息(如学生的思维过程草稿)来辅助评估;以及建立更透明的AI评分解释机制,让教师和学生能够理解评分背后的逻辑。同时,教育数字化转型的推进也需要配套的伦理框架和法律规范,确保学生数据得到充分保护。

对于普通用户而言,这则AI新闻提醒我们:不要盲目迷信AI的“智能”。哪怕是看似简单的批改作业任务,背后也涉及复杂的认知判断。在享受AI技术带来的便利时,保持批判性思维和人文关怀,或许才是我们最需要的能力。