AI 作文自动评分靠谱吗?最新研究揭示的准确度与局限

作文自动评分,就是由 AI 阅读学生的作文,对照评分标准(评分量规)进行比对,在几秒钟内给出分数和评语。2026 年的研究表明,AI 在部分任务上可以给出与人工阅卷相当接近的分数,但它看重的方面与人不同,而且很难准确评判特别差和特别好的作文。因此对老师来说,AI 批改最适合用作"初评"和修改辅助,而不是替代老师自己的评价。
Clasa 开发的是基于评分标准的 AI 作文批改工具。正因如此,我们一直密切关注这方面的研究,并引用独立研究,而不是拿自己的工具当标准。本文梳理最新研究对 AI 作文评分到底说明了什么,以及这对国内的老师意味着什么。
什么是作文自动评分?
作文自动评分(英文 Automated Essay Scoring,简称 AES)是指利用人工智能、机器学习或自然语言处理技术,按照预先设定的标准或评分量规来评价作文。系统给出建议分数,老师就不必手工完成每一篇作文的初评。根据工具不同,它会考察错别字和语法、词汇、结构、内容,以及是否切题。
作文自动评分并不是新事物。早在 20 世纪 60 年代,Project Essay Grade(PEG)就已经用计算机分析文章;美国 ETS 的 e-rater 也已在英语写作评估中使用了几十年。如今的系统基于神经网络和大语言模型(LLM),不仅能处理表层的语言特征,还能理解文意,并按照细致的评分标准来评判。
也就是说,今天的 AI 评分不只是数字数、标错误。它可以同时评价作文的多个方面,所以有必要把它和常被混为一谈的工具区分开来:
| 工具 | 主要作用 | 提供什么 | 主要用户 |
|---|---|---|---|
| 错别字与语法检查 | 找出语言错误 | 错别字、语法、标点和用词修改建议 | 学生和写作者 |
| 写作自动反馈(AWE) | 帮助修改提升 | 关于结构、表达和内容展开的建议 | 学生和老师 |
| 作文自动评分(AES) | 按评分标准打分 | 分数,以及(视工具而定)各维度的评语 | 老师和学校 |
区别在于目的:语法检查修正语言,自动反馈帮助修改,作文自动评分则按既定标准评价作文并给出分数。
AI 是怎样给作文打分的?
不同模型的做法不尽相同,但一般来说,AI 会综合考虑语言、结构、内容和评分标准中的各个维度。
语言规范与词汇
AI 能稳定地发现错别字、标点错误和不恰当的用词,这有助于判断语言运用能力。但语法再完美,如果思想单薄、缺乏论据,也算不上好作文。真正有用的工具,必须看到语言表层之下的东西。
结构与连贯
AI 还能评价文章是否条理清楚:开头是否点明题意,段落是否按逻辑顺序展开,结尾是否回扣中心论点。
这是生成式 AI 相对擅长的领域。Huang、Palermo 和 Wilson(2026)分析了 1,768 篇三、四年级学生的作文,发现经过精心设计提示词(prompt)的 GPT-4o,在结构和文风的评分上更接近人工评分;而较早的基于特征的评分系统,在内容展开和表层特征上与人工评分更一致。
内容与论证
评价文章的实质内容要难得多。只表达观点是不够的,观点需要展开,需要论据支撑。大语言模型借助评分标准也能评价这些方面,但它的判断可能与人类读者不同。
Wang、Chen、Huang 和 Lai(2026)比较了通义千问(Qwen)、GPT、Gemini 与人工评分者对非英语母语学生英语作文的评分。模型更看重语法准确性、词汇和句子复杂度;人工评分者更看重内容是否完整,也会留意卷面呈现,对小的语言错误更宽容。而且,人工评分在不同水平的学生之间更加稳定。
是否切题、是否符合评分标准
靠谱的 AI 评分还会检查学生是否真正回答了题目。如果评分标准要求"用论据阐述观点",AI 就能针对这一点打分。
评分标准之所以关键,是因为 AI 自己并不知道什么是"好作文",它只知道你给它的评价维度。这正是基于评分标准的评分成为当今 AI 评价核心的原因。
比如,老师设定一个名为"论据运用"的维度,AI 就会检查中心论点是否有恰当的事例或材料支撑。如果你还没有评分标准,可以用免费的 AI 评分标准生成器根据作业生成一份,也可以参考我们的指南《如何制作评分标准》一步步来做。
| 评分维度 | AI 关注什么 | 评语示例 |
|---|---|---|
| 论据运用 | 是否有恰当的论据支撑中心论点 | "中心论点很明确,但第二段需要更有说服力的论据来支撑。" |
所以,AI 并不是在判断一篇作文"读起来顺不顺",而是在对照老师设定的具体维度进行检查。
作文自动评分到底准不准?
关键问题是:AI 给的分数是否足够接近老师的分数,从而真正有用?研究的回答是:可以,但有重要前提——准确度取决于模型、学生、任务,以及如何衡量准确度。
先说明一点:目前 AI 作文评分的研究大多来自英语国家,本文引用的研究也都以英语文本为对象。中文作文、尤其是议论文和高考作文这类有固定要求的文体,能否得到同样的结果,还缺乏充分验证。请把这些结论当作参考,而不是保证。
Huang、Palermo 和 Wilson(2026)用 1,768 篇三、四年级作文,比较了 GPT-4o 和传统的基于特征的评分系统。精心设计提示词后,GPT-4o 接近了人工与传统系统之间的一致度;针对该任务专门微调(fine-tuning)的 GPT-4o 准确度最高。即便如此,没有一个模型能完全消除不同学生群体之间的差异。
Zhou(2026)用信号检测论分析了 8 个大语言模型评分的 1,726 篇作文。这种方法衡量评分者区分差作文和好作文的能力。结果显示,人工评分者的区分能力大约是 AI 的两倍。大语言模型倾向于把分数集中在量表中段,很少给出评分标准中的最高等级。
这两类结果并不矛盾。"一致度"衡量 AI 与人工分数整体上吻合的频率;由于大多数作文处于中等水平,AI 在这里表现尚可。"区分度"衡量 AI 能否分辨差作文和优秀作文,而这恰恰是 AI 的短板。
人工阅卷之间也有分歧
评分不完美,人也一样。正因为如此,高考作文才实行多评制度。以北京为例,2024 年的报道介绍,各科目试题全部实行"背靠背双评":两位评卷老师独立评分、互不知晓对方给分,双评分差超过阈值的,再进行三评甚至四评。
所以,真正该问的不是 AI 能否"给出正确分数",而是和第二位人工评卷老师相比,AI 是否错得更多,或者错的方式不同。从上面的研究来看,AI 错的方式不同:它把分数往中间压,并且更看重形式而不是内容。
人工评分与 AI 各自看重什么
| 评价对象 | 人工评分者倾向于 | AI 倾向于 | 对老师意味着什么 | 来源 |
|---|---|---|---|---|
| 语法、词汇和句子复杂度 | 对小错误比较宽容 | 更看重这些特征 | 语言漂亮但内容空洞的作文,AI 可能比你给分更高 | Wang et al. (2026) |
| 内容是否完整 | 非常看重 | 看得比语言特征轻 | 检查作文是否真正切题、写透 | Wang et al. (2026) |
| 特别差和特别好的作文 | 用足整个分数区间 | 把分数集中在中间,很少给满分 | 可能得最高分和最低分的作文,最好亲自读 | Zhou (2026); Kay et al. (2026) |
| 结构与文风 | 作为标准 | 精心设计提示词的 GPT-4o 在三、四年级作文上接近人工评分 | 作为结构方面评语的初稿还不错 | Huang et al. (2026) |
"稳定"不等于"准确"
| 术语 | 含义 |
|---|---|
| 信度 | 对同一篇作文能否稳定地给出相同分数 |
| 准确度 | 分数与可靠参照(如经过培训的阅卷老师的评分)有多接近 |
| 效度 | 分数是否真正衡量了评分标准想要考查的写作能力 |
| 公平性 | 对不同学生群体的评价是否同样准确 |
这些概念常被混用,但衡量的东西并不相同。一个系统可以每次都给出同样的分数,却每次都错得一样。
Debelak 和 Ziegler(2026)说明了为什么四项都要检验。他们在 PLOS One 发表的方法论文中,检验了一个用公开英语作文数据集 Hewlett ASAP 训练的 DistilBERT 模型:该模型内部一致性很高,Spearman-Brown 系数在 0.77 到 0.92 之间,也有效度方面的证据;但在不同作文题目之间比较人工和 AI 评分时,出现了公平性不足的迹象。他们的结论是:信度、效度和公平性必须一起评估。
AI 评分会改变学生的写作方式吗?
AI 正在改变评价方式,也可能在改变写作本身。过去的流程是"写作、上交、等待批改"。有了 AI 作文批改,反馈即时返回,于是形成了"写作、获得反馈、修改、再检查"的快速循环。
这对过程性评价很有价值。学生可以让 AI 指出论证薄弱或衔接不畅的段落,在交给老师之前先修改草稿。所以,AI 反馈在修改阶段最有用,而不是在作业交上去之后。
但风险也存在。如果学生发现 AI 偏爱某些词汇或句式,就可能开始"写给机器看",写出更加模式化、缺少独立思考的文章。
很多语文老师对"堆砌辞藻、套用万能素材"的作文并不陌生。写给机器的句子可能是这样的:"教育场域中技术融合所蕴含的多维度意涵,亟需系统性、全方位的审视与评估。"写给读者的句子则是:"学校在用 AI 打分之前,应该先试用这些工具。"由于 Wang 等人(2026)研究中的模型比人工评分者更看重词汇和句子复杂度,前一句在 AI 那里可能得分更高。但任何一位老师都会选择后一句。
AI 反馈应该让文章更清楚,而不是更花哨。学生最能受益的做法,是根据关于论点、论据和结构的评语去修改;如果是靠堆砌生僻词提高了分数,应该把它当作警示信号,而不是目标。
作文自动评分能给老师带来什么?
很多语文老师都有这样的体会:一次大作文布置下去,一摞作文本就要改上好几个晚上。AI 评分的主要好处是节省时间、初评标准统一、反馈更及时。AI 可以快速浏览大批作文,找出全班的共性问题,并给学生可用于修改的具体反馈。
自动评分系统给第一百篇作文打分的标准和第一篇完全一样,可以减少人工批改一大摞作文时标准逐渐走样的问题。但一致不等于公平:一个有偏差的系统,会一致地产生偏差。
即时反馈能在学生写作过程中帮到他们。对学校而言,AI 可以让每一份作业都得到初评,而不必为每一份都安排一位人工阅读者。想更全面地了解工具和课堂应用,可以看看我们的指南《教育中的 AI 评分》。
在课堂上,AI 最好的用法是辅助老师,而不是取代老师。把初评、修改建议和按评分标准的统一检查交给系统,你就能把时间花在每个学生需要的个别指导上。审核结果、做最终判断的,是老师。
如果你想试试基于评分标准的 AI 批改,可以免费试用 Clasa。上传作文和你的评分标准,就能得到逐项的评分结果,并且可以在返还学生之前审核、修改评语。
作文自动评分的局限
尽管进步明显,作文自动评分仍有清晰的短板。
AI 不会像老师那样读作文
AI 能处理海量文字,但它并不像人一样阅读作文。老师凭借经验、语境知识和对学生的了解,能读出 AI 常常忽略的细微含义。正如上面的研究所示,AI 和人可能给出相近的分数,理由却不一样,因为二者对语言、内容和卷面的权重不同。
偏差与公平
偏差是第二个问题。在同一项针对 1,768 篇三、四年级作文的研究中,Huang、Palermo 和 Wilson(2026)考察了不同群体之间的公平性:不同性别、以英语为第二语言的学生,以及特殊教育学生。经过微调的 GPT-4o 整体上最公平,但没有一个模型完全消除了群体差异。
这并不是说所有 AI 评分都同样存在偏差,而是说任何系统在用于重要决定之前,都应该在不同学生群体和不同任务上接受检验。
分数向中间挤
AI 还倾向于压缩分数。老师会自然地用足整个分数区间,从很差到很好;而许多大语言模型会回避两端。在 Zhou(2026)对 1,726 篇作文的研究中,模型表现出明显的趋中倾向,很少给出评分标准中的最高等级。区分一篇出类拔萃的作文和一篇只是不错的作文,对这些系统来说很难。
放到语文作文上,就是 AI 最难判断的,恰恰是"一类文"和"二类文"之间的那条线,而高分作文的差距往往就在这里。
同样的规律也出现在大学里。卡迪夫大学和墨尔本大学的 Kay 等人(2026)让两个版本的 ChatGPT 批改 50 篇生物科学专业本科论文。整体分数常常与人工评分接近,但具体到每篇论文就不一样了:AI 给较差的论文打分偏高,给较好的论文打分偏低,在中间分数段吻合得最好。作者的结论是,生成式 AI 目前还无法可靠地批改篇幅较长的书面作业。
学生也可能试图用无谓的长度、生僻词汇或重复内容来"刷分"。好的 AI 评分应该依据评分标准和论证质量,而不是表层特征。
放之四海而皆准的评语
分数可能是对的,评语却没什么用。AI 有时会写出看似有用、其实放在任何一篇作文上都成立的评语,比如"内容可以再具体一些"。与具体维度、具体段落挂钩,并在返还学生之前经过老师审核和修改的评语,要有用得多。
模型之间的差异
Jiao、Song 和 Lee(2026)在两项写作任务上比较了 GPT、Claude、Gemini 和 DeepSeek 系列的 10 个模型,发现它们在评分一致性和表现上存在明显差异。由于样本较小,作者没有给模型排名。
所以,"AI 批改"这几个字本身说明不了多少问题。关键要看用的是哪个模型、怎么设置的、经过了怎样的检验。
AI 可以直接给学生打最终分数吗?
除了教学问题,还有政策和法规层面的问题,而两者指向同一个方向。
教育部的指引。 教育部教师队伍建设专家指导委员会于 2025 年 11 月发布的《教师生成式人工智能应用指引(第一版)》允许教师利用生成式人工智能对作文、论述、报告等主观类作业进行初步批阅,但明确规定:"不得将生成式人工智能对作文、艺术作品、开放性作业等的自动批改结果作为学生最终评价予以直接使用"。正如新华网的评论所说,AI 适合承担基础性、重复性的工作,而对学生思维水平和创造性表达的判断,仍要由老师来把握。
个人信息保护。 学生作文里可能包含姓名、家庭情况等个人信息。同一份指引要求严格遵守国家数据安全与个人信息保护相关法律法规,使用前须评估工具及平台的数据合规性。根据《个人信息保护法》,不满十四周岁未成年人的个人信息属于敏感个人信息,处理时需要取得其父母或其他监护人的同意。
在使用 AI 批改工具之前,学校应当弄清楚:
- 作文存储在哪里、在哪里处理?
- 作文会不会被用来训练 AI 模型?
- 保存多长时间,能否彻底删除?
- 是否符合所在地区教育部门和学校的相关规定?
日常可以做的一件简单的事:上传之前删去学生姓名等可识别身份的信息。拿不准的时候,可以咨询学校的信息化或数据安全负责人。本节仅为一般性说明,不构成法律意见。
AI 能取代老师批改作文吗?
AI 已经可以承担一部分批改工作,尤其是快速初评、标出常见问题,以及在大量作文中逐项核对评分标准。
但要完全取代人的判断,就是另一回事了。理解细微之处、欣赏有创意或不落俗套的作文、质疑看起来不对劲的 AI 分数,都离不开老师。重要的评价,应当由老师来决定。
把这些研究放在一起看,答案不是在 AI 和人之间二选一,而是人机协同。现实的问题是:哪项工作由谁来做更好?
- 草稿与修改: AI 做初评并提出修改建议,老师抽查。
- 日常作文练习: AI 按评分标准打分,老师审核分数、修改评语后再返还。
- 单元测试、期中期末等重要考试: 老师阅读并决定分数。AI 可以提示问题,但不定分。
- 有创意、不落俗套或处于临界分数的作文: 老师通读全文,尤其是可能拿最高分和最低分的作文。
想具体比较各种工具,可以看我们的《教师最佳 AI 作文批改工具对比》。
作文自动评分的未来
研究者正在尝试用更好的评分标准、提示词和样卷,缩小 AI 与人工评分之间的差距。
Choi、Tate 和 Warschauer(2026)在《Assessing Writing》期刊上发表的研究显示,在提示词中加入"锚定样卷",也就是已经评好分的示例作文,能显著提高大语言模型与人工评分的一致度,使其接近两位人工评分者之间的一致度。覆盖整个分数区间的样卷,比只覆盖部分等级的样卷效果更好。GPT-4o 表现最佳,而 GPT-4o mini 以低得多的成本取得了相近的结果。
对老师来说,这个发现既实用又熟悉。它和阅卷前用样卷统一评分尺度是同一个道理。给 AI 提供几篇从低分到高分、覆盖整个分数区间的已评样卷,是让 AI 的分数更接近你的评分最简单的方法之一。
研究者也在研究 AI 是如何得出分数的:它看重哪些文本特征,这些权重会不会随学生水平变化,结果对各类学生群体是否公平。针对中文作文的研究也还需要更多。光是出分快还不够,AI 评分要真正有用,必须能促进学习,并经得起独立检验。
关于作文自动评分的常见问题
什么是作文自动评分?
它是一种阅读作文、并按照既定标准或评分量规打分的软件。早期系统主要统计语言特征,如今的系统则使用能直接理解老师评分标准的大语言模型。它是评价工具,而不是错别字检查工具,不过很多产品两种功能都有。
AI 批改作文是怎么工作的?
系统阅读作文,逐项对照评分标准,给出建议分数,通常还会附上各维度的评语。使用大语言模型时,你提供的评分标准和已评分的示例作文,会在很大程度上决定结果。清晰具体的评分标准,比模糊的标准更能得到一致的分数。
AI 给作文打分准吗?
取决于模型、评分标准和文体。在 1,768 篇三、四年级作文中,经过微调的 GPT-4o 最接近人工评分(Huang、Palermo 和 Wilson,2026)。在 8 个大语言模型评分的 1,726 篇作文中,人工评分者区分差作文和好作文的能力大约是 AI 的两倍(Zhou,2026)。请把 AI 的分数当作初评,并加以审核。
可以直接用 AI 的批改结果作为学生的成绩吗?
不可以直接使用。教育部《教师生成式人工智能应用指引(第一版)》明确规定,不得将生成式人工智能对作文等的自动批改结果作为学生最终评价予以直接使用。AI 可以做初步批阅,最终评价要由老师审核后作出。
学生能骗过 AI 批改吗?
有时可以。一些模型比人工评分者更看重语言的复杂程度,所以长句和生僻词可能会抬高分数。明确奖励论据和论证的评分标准,能减少"注水"的空间;对于分数高于预期的作文,老师最好抽查一下。
把学生作文上传给 AI 安全吗?
要看具体工具。弄清楚作文存储在哪里、会不会被用来训练 AI 模型、保存多长时间。遵守《个人信息保护法》和学校的相关规定,上传前删去学生姓名等个人信息。
作文自动评分有哪些缺点?
AI 评分可能在不同学生群体之间存在公平性差异,对某些作文的评价也可能与老师不同。它难以评判特别差和特别好的作文,倾向于把分数集中在中间。它还可能给出看似有用、却没有针对这篇作文的笼统评语。
AI 批改能提高写作水平吗?
如果学生利用 AI 反馈来修改作文,就有可能提高。效果来自落实关于论点、论据和结构的评语。目标应该是让思路更清晰,而不是写出讨 AI 喜欢的文章。
结语
作文自动评分可以为老师节省时间,让学生更快得到反馈,但它仍有局限。AI 在平均水平上可能与老师一致,却分辨不出差作文和优秀作文之间的差别,对不同学生群体的评价也可能不一样。
最好的做法是:用 AI 做初评和修改反馈,把最终评分留给老师。想看看用你自己的评分标准做逐项初评是什么效果,可以免费试用 Clasa。