早上读到一篇很有意思的文章,
这是一篇预印本论文,作者是沙特阿卜杜勒‑阿齐兹国王大学的 Rayed AlGhamdi。
论文的题目是《谁应该给我的作业评分?高等教育中透明的人工智能辅助写作评估的学生视角》(Who Should Grade My Work? Student Perspectives on Transparent AI‑Assisted Writing Assessment in Higher Education)。
在生成式 AI 越来越多地走进课堂的今天,许多一线教师会用生成式人工智能给学生写作提供反馈,用AI批改作文,批量批改学生作业已经变成了许多地方人工智能教育应用的核心场景,许多企业也推波助澜推出了作业批改方面的AI应用。
一个很现实的问题随之而来:
如果分数和评价本身就是 AI 给出的,学生知道真相之后,会怎么想?
这篇研究没有纠结 “AI 打分准不准”,而是把目光投向学生的真实看法,读完带给我不少启发。
一、这项研究想要回答什么?
作者提出了三个很接地气的研究问题:
1、当学生明确知道反馈来自 ChatGPT,他们会如何看待这份 AI 生成的反馈?
2、学生如何看待 ChatGPT 充当作业评价者这一角色?
3、在学生的反思里面,会浮现出哪些教学与制度层面的深层担忧?
当下很多研究热衷于验证 “AI 反馈能不能提升写作成绩”,但是却很少关注:学生知情之后的态度、信任、对评价权力的思考。
这恰恰是本研究最有价值的地方。
二、研究是怎么开展的?
这是一项课程内嵌的质性教学探究,全部工作发生在真实大学课堂,不是实验室实验。
作者本人就是该研究中的课程的授课教师,他自己亲自讲授计算机本科生的《技术沟通》课程,论文的数据就来自他课堂开展的教学探究项目arXiv。
研究对象是沙特阿卜杜勒‑阿齐兹国王大学的13 名计算机专业大二男生。
为了保证写作确确实实出自学生本人,避免 AI 代写的干扰,研究者要求学生当堂手写完成写作任务。
整个研究流程可以简单概括为六步:
1、学生课堂手写完成写作任务;
2、将手写作业扫描数字化;
3、ChatGPT 依据课程评分量规,给出反馈和分数;
4、关键干预:明确告诉学生,这份分数与反馈由 ChatGPT 生成,并非教师批改;
5、学生当堂手写完成反思,回答三件事:是否同意 AI 打分、自己写作有什么收获、如何看待 AI 做评价者;
6、收集 13 份反思文本,采用归纳式主题分析,提炼核心观点。
这里有一个对照组背景:
作者之前做过同课程的盲测研究,学生并不知道评价来自 AI。
而这个研究的核心变量就是透明披露 AI 的参与。
在数据分析环节,研究者本人先用 NVivo 做开放编码,之后还使用 Claude 做一轮独立验证编码,用来校验主题框架,不过全部解释权仍然掌握在人类研究者手里。
同时,研究也做了充分伦理处理,所有作业匿名化,把研究活动嵌套进正常课程,尽可能降低教师兼任研究者带来的回答偏差。
当然,我们也要看到研究的局限:
样本规模不大,全部为单一学校计算机专业男生,因此,结论不能无限制推广到所有学生群体;同时,和早期盲测研究之间存在时代、学生群体差异,不能直接做严格的因果对比。
三、研究有哪些有意思的发现?
通过对学生反思文本的分析,研究者提炼出四个核心主题。
最打动我的,是学生身上展现出来的 “有条件信任”。
1、学生普遍认可 AI 反馈的实用价值
所有参与的学生都承认 ChatGPT 反馈是有用的。AI 能够清晰指出语法、句子结构、篇章组织等表层写作问题,反馈具体、客观。对于大班课教师反馈不足、反馈滞后的现实困境,AI 反馈确实能够补齐一部分教学缺口。
2、学生也能清醒看见 AI 的局限
学生并不是盲目迷信 AI。
他们看到两类局限:一是技术局限,手写扫描会被 AI 误读文字,进而造成错误评判;二是语境局限,AI 不熟悉本门课的评分体系,看不懂学生写作背后付出的努力,还容易给出一味讨好的正向评价,只能作为初步参考。
3、核心洞见:区分“反馈效用”和“评价权威”
这是整篇论文最大的概念贡献。
学生的态度不是简单的 “全盘接受 AI” 或者 “全盘否定 AI”。
他们可以一边说:“这份反馈写得很好,对我修改作文很有帮助”;另一边又坚定主张:但是最终的打分权,不能交给 AI,必须由老师掌握。
换句话说:AI 可以当助教,给修改建议;但不能当裁判,判定学业成绩。
这是两套相互独立的判断标准,不是非黑即白。
AI 输出必须经过教师复核,才能够作为正式成绩。
4、重新思考人类教师不可替代的制度与教学角色
学生进一步追问更深层的问题:
如果考试和作业都交给 AI 评判,那我们为什么还要来上大学?
在学生眼中,教师的价值不只是改错别字。教师了解每一位学生的个体情况;评价是可以对话、可以申诉的人际实践;教师作为 “人”,还承担着兜底的责任,防止 AI 犯错给学生带来不公平的后果。学生不是排斥 AI 工具,而是捍卫人类教师在评价环节的权威地位。
当反思放在 “拿到分数之后”,学生的思考就跳出了 “如何修改一句话”,上升到 “到底谁有权力评判我的学业” 这类制度层面的思考。
透明告知 AI 参与评估这件事,本身就成为一种教学策略,倒逼学生开展批判性思考。
四、给一线教育工作者的启示
基于研究发现,作者提出了用于写作评估中伦理使用生成式 AI 的三大原则:
透明性、人类中介、反思实践。
1、透明性:教师要明确告知学生,哪些评价环节用到了 AI;把 AI 使用写进评价标准,培养学生的 AI 素养。
2、人类中介:教师要审阅 AI 产出的全部内容,牢牢握住最终打分权,设置学生申诉通道。AI 只是辅助工具,不能取代人的判断。
3、反思实践:在用过 AI 评价之后,可以布置简单的反思任务,问问学生是否认同 AI 给出的反馈,鼓励学生批判性看待机器输出。
总的指导思想是:AI 增强评估,而不是取代人的判断。
很多时候,我们讨论人工智能教育应用,很容易滑向两个极端:
要么一味禁止,要么完全放手交给机器。
而这群沙特大学生给我们展示了第三种可能性:接纳 AI 做辅助反馈,但守住人类评价权威的底线。
透明,不只是伦理义务,它本身就是一种教学手段。
把 AI 参与评价这件事摊开来讲,反而可以锻炼学生的批判性思维,让学生学会分辨:哪些机器建议值得采纳,哪些机器评判需要警惕。
当然我们也要记住,这项研究样本有限,更多跨文化、跨学科的实证,还等待后续研究者继续探索。
五、我的一点思考
在今天,不少教师会使用大模型辅助批改作业。
读完这篇论文,值得我们追问自己几个问题:
1、如果我们用 AI 生成反馈甚至分数,有没有告诉学生真相?
2、我们有没有把最终评价权牢牢握在教师手中?
3、我们有没有给学生机会,让他们对 AI 的评判提出质疑、表达不同意见?
技术永远向前,但教育评价背后的人的因素,依然值得我们反复审视。
AlGhamdi, R. (2026). Who Should Grade My Work? Student Perspectives on Transparent AI‑Assisted Writing Assessment in Higher Education. arXiv preprint.

松山俯瞰夜色美如画. Photo by Johnnie Walker