AI 作文自動評分可靠嗎?從最新研究看準確度與限制

作文自動評分,就是由 AI 閱讀學生的作文,對照評分規準進行比對,在幾秒內給出分數與評語。2026 年的研究顯示,AI 在部分任務上能給出與人工閱卷相當接近的分數,但它重視的面向和人不同,也很難準確評斷特別弱和特別好的作文。因此對老師來說,AI 批改最適合當作「初閱」與修改輔助,而不是取代老師自己的評量。
Clasa 開發的是以評分規準為基礎的 AI 作文批改工具。正因如此,我們持續關注這方面的研究,並引用獨立研究,而不是拿自己的工具當標準。這篇文章整理最新研究對 AI 作文評分到底說了什麼,以及這對台灣的老師有什麼意義。
什麼是作文自動評分?
作文自動評分(英文 Automated Essay Scoring,簡稱 AES)是指運用人工智慧、機器學習或自然語言處理技術,依照事先訂定的標準或評分規準來評量作文。系統提出建議分數,老師就不必親手完成每一篇作文的初閱。依工具不同,它會檢視錯別字與語法、詞彙、結構、內容,以及是否切題。
作文自動評分並不是新技術。早在 1960 年代,Project Essay Grade(PEG)就已經用電腦分析文章;美國 ETS 的 e-rater 也已在英文寫作評量中使用了數十年。現在的系統以神經網路和大型語言模型(LLM)為基礎,不只能處理表面的語言特徵,也能理解文意,並依照細緻的評分規準來評斷。
換句話說,今天的 AI 評分不只是計算字數或標出錯誤。它能同時評量作文的多個面向,所以值得和常被混為一談的工具區分清楚:
| 工具 | 主要功能 | 提供什麼 | 主要使用者 |
|---|---|---|---|
| 錯別字與語法檢查 | 找出語文錯誤 | 錯別字、語法、標點與用詞的修改建議 | 學生與寫作者 |
| 寫作自動回饋(AWE) | 協助修改 | 關於結構、表達與內容發展的建議 | 學生與老師 |
| 作文自動評分(AES) | 依評分規準給分 | 分數,以及(視工具而定)各評量面向的評語 | 老師與學校 |
差別在於目的:語法檢查修正語文錯誤,自動回饋協助修改,作文自動評分則依既定標準評量作文並給出分數。
AI 是怎麼替作文打分數的?
各模型的做法不盡相同,但一般來說,AI 會綜合考量語文表達、結構、內容與評分規準中的各個面向。
語文表達與詞彙
AI 能穩定找出錯別字、標點錯誤和不恰當的用詞,這有助於判斷語文能力。但語法再完美,如果思想單薄、缺乏論據,也稱不上好作文。真正有用的工具,必須看見語言表面之下的東西。
結構與連貫
AI 也能評量文章是否條理分明:開頭是否點出題旨,段落是否依邏輯順序發展,結尾是否回扣核心論點。
這是生成式 AI 相對擅長的領域。Huang、Palermo 與 Wilson(2026)分析了 1,768 篇國小三、四年級學生的作文,發現經過精心設計提示詞(prompt)的 GPT-4o,在結構與文風的評分上更接近人工評分;而較早的特徵式評分系統,則在內容發展與表面特徵上與人工評分較一致。
內容與論證
評量文章的實質內容困難得多。只表達觀點並不夠,觀點需要發展,也需要論據支持。大型語言模型借助評分規準也能評量這些面向,但它的判斷可能和人類讀者不同。
Wang、Chen、Huang 與 Lai(2026)比較了 Qwen、GPT、Gemini 與人工評分者對非英語母語學生英文作文的評分。模型比較重視語法正確性、詞彙與句子複雜度;人工評分者比較重視內容是否完整,也會留意版面呈現,對小的語文錯誤較為寬容。而且,人工評分在不同程度的學生之間更加穩定。
是否切題、是否符合評分規準
可靠的 AI 評分也會檢查學生是否真正回應了題目。如果評分規準要求「舉出論據說明觀點」,AI 就能針對這一點評分。
評分規準之所以關鍵,是因為 AI 自己並不知道什麼是「好作文」,它只知道你給它的評量面向。這正是以評分規準為基礎的評分成為現今 AI 評量核心的原因。
例如,老師設定一個「論據運用」的評量面向,AI 就會檢查核心論點是否有恰當的例證或資料支持。如果你還沒有評分規準,可以用免費的 AI 評分規準產生器依作業產生一份,也可以參考我們的指南〈評分規準怎麼做?〉一步步設計。
| 評量面向 | AI 關注什麼 | 評語範例 |
|---|---|---|
| 論據運用 | 是否有恰當的論據支持核心論點 | 「核心論點很清楚,但第二段需要更有說服力的論據來支持。」 |
所以,AI 並不是在判斷一篇作文「讀起來順不順」,而是在對照老師設定的具體面向進行檢查。
作文自動評分到底準不準?
關鍵問題是:AI 給的分數是否夠接近老師的分數,真正派得上用場?研究的答案是:可以,但有重要前提——準確度取決於模型、學生、任務,以及如何衡量準確度。
先說明一點:目前 AI 作文評分的研究大多來自英語國家,本文引用的國外研究也都以英文文本為對象。中文作文,特別是學測國寫這類有明確題型的寫作,能否得到同樣的結果,仍缺乏充分驗證。請把這些結論當作參考,而不是保證。
Huang、Palermo 與 Wilson(2026)用 1,768 篇國小三、四年級作文,比較 GPT-4o 與傳統的特徵式評分系統。精心設計提示詞後,GPT-4o 接近了人工與傳統系統之間的一致度;針對這項任務進行微調(fine-tuning)的 GPT-4o 準確度最高。即便如此,沒有任何模型能完全消除不同學生群體之間的差異。
Zhou(2026)用訊號偵測理論分析了 8 個大型語言模型評分的 1,726 篇作文。這種方法衡量評分者區分弱作文與好作文的能力。結果顯示,人工評分者的區辨能力大約是 AI 的兩倍。大型語言模型傾向把分數集中在量尺中段,很少給出評分規準中的最高等級。
這兩類結果並不矛盾。「一致度」衡量 AI 與人工分數整體吻合的頻率;由於多數作文落在中等程度,AI 在這裡表現還算不錯。「區辨力」衡量 AI 能否分辨弱作文與優秀作文,而這正是 AI 的弱點。
人工閱卷之間也有落差
評分不完美,人也一樣。這正是大考中心國寫閱卷設計多重把關的原因。依大考中心 115 學年度學測國寫閱卷評分原則說明,這次共有 162 位閱卷委員參與。每份試卷由系統隨機分給兩位委員獨立評分,成績取兩閱平均;如果兩閱分數差距超過預設的差分標準,就進行第三閱,必要時還有第四閱。
所以,真正該問的不是 AI 能否「給出正確分數」,而是和第二位閱卷老師相比,AI 是否錯得更多,或錯的方式不同。從上面的研究來看,AI 錯的方式不同:它把分數往中間壓,而且比較重視形式而不是內容。
人工評分與 AI 各自重視什麼
| 評量對象 | 人工評分者傾向 | AI 傾向 | 對老師的意義 | 來源 |
|---|---|---|---|---|
| 語法、詞彙與句子複雜度 | 對小錯誤較寬容 | 更重視這些特徵 | 文字漂亮但內容空洞的作文,AI 可能比你給分更高 | Wang et al. (2026) |
| 內容是否完整 | 非常重視 | 看得比語文特徵輕 | 檢查作文是否真正切題、寫得深入 | Wang et al. (2026) |
| 特別弱與特別好的作文 | 使用整個分數區間 | 把分數集中在中間,很少給滿分 | 可能拿最高分與最低分的作文,最好親自讀 | Zhou (2026); Kay et al. (2026) |
| 結構與文風 | 作為標準 | 精心設計提示詞的 GPT-4o 在國小三、四年級作文上接近人工評分 | 當作結構方面評語的初稿還不錯 | Huang et al. (2026) |
「穩定」不等於「準確」
| 術語 | 意義 |
|---|---|
| 信度 | 對同一篇作文能否穩定給出相同分數 |
| 準確度 | 分數與可靠參照(例如受過訓練的閱卷老師)有多接近 |
| 效度 | 分數是否真正衡量了評分規準想評量的寫作能力 |
| 公平性 | 對不同學生群體的評量是否同樣準確 |
這些概念常被混用,但衡量的東西並不相同。一個系統可以每次都給出一樣的分數,卻每次都錯得一樣。
Debelak 與 Ziegler(2026)說明了為什麼四項都要檢驗。他們在 PLOS One 發表的方法論文中,檢驗了一個以公開英文作文資料集 Hewlett ASAP 訓練的 DistilBERT 模型:模型內部一致性很高,Spearman-Brown 係數介於 0.77 到 0.92,也有效度方面的證據;但在不同作文題目之間比較人工與 AI 評分時,出現了公平性不足的跡象。他們的結論是:信度、效度與公平性必須一起評估。
台灣的發展:EDU-TAIDE
台灣也已經開始發展本土的作文輔助評閱工具。教育部委辦、由國立暨南國際大學執行的「114年教育部EDU-TAIDE模型中文應用計畫」,正在建置 AI 輔助國寫閱卷系統,目的是減輕老師批閱作文的負擔,並提供即時的寫作回饋。計畫也透過工作坊邀請高中老師試用系統、提供意見,再回饋到 AI 評閱模型與網站的建置中。
這個方向和國外研究的結論一致:讓 AI 負責初閱與回饋,讓老師保留專業判斷,並且讓第一線老師參與工具的改進。
AI 評分會改變學生的寫作方式嗎?
AI 正在改變評量方式,也可能正在改變寫作本身。過去的流程是「寫作、繳交、等待批改」。有了 AI 作文批改,回饋立即返回,於是形成「寫作、取得回饋、修改、再檢查」的快速循環。
這對形成性評量很有價值。學生可以請 AI 指出論證薄弱或銜接不順的段落,在交給老師之前先修改草稿。所以,AI 回饋在修改階段最有用,而不是在作業交出去之後。
但風險也存在。如果學生發現 AI 偏好某些詞彙或句型,就可能開始「寫給機器看」,寫出更公式化、缺少獨立思考的文章。
很多國文老師對「堆砌詞藻、套用萬用範文」的作文並不陌生。寫給機器的句子可能長這樣:「教育場域中科技整合所蘊含的多重面向意涵,亟需系統性且全面性的審視與評估。」寫給讀者的句子則是:「學校在用 AI 打分數之前,應該先試用這些工具。」由於 Wang 等人(2026)研究中的模型比人工評分者更重視詞彙與句子複雜度,前一句在 AI 那裡可能得分更高。但每一位老師都會選後一句。
AI 回饋應該讓文章更清楚,而不是更華麗。學生最能受益的做法,是依照關於論點、論據與結構的評語去修改;如果是靠堆砌艱深詞彙提高了分數,應該把它當成警訊,而不是目標。
作文自動評分能為老師帶來什麼?
很多國文老師都有這樣的經驗:一次作文出下去,一疊作文就要改上好幾個晚上。AI 評分的主要好處是節省時間、初閱標準一致、回饋更即時。AI 能快速瀏覽大量作文,找出全班的共同問題,並給學生可以拿來修改的具體回饋。
自動評分系統給第一百篇作文打分數的標準和第一篇完全一樣,能減少人工批改一大疊作文時標準逐漸走樣的問題。但一致不等於公平:有偏差的系統,會一致地產生偏差。
即時回饋能在學生寫作過程中幫上忙。對學校來說,AI 能讓每一份作業都得到初閱,而不必替每一份安排一位人工閱讀者。想更全面了解工具與課堂應用,可以參考我們的指南〈教育中的 AI 評分〉。
在課堂上,AI 最好的用法是協助老師,而不是取代老師。把初閱、修改建議和依評分規準的一致檢查交給系統,你就能把時間花在每個學生需要的個別指導上。檢視結果、做出最後判斷的,是老師。
如果你想試試以評分規準為基礎的 AI 批改,可以免費試用 Clasa。上傳作文和你的評分規準,就能得到逐項的評分結果,並在交還學生之前檢視、修改評語。
作文自動評分的限制
儘管進步明顯,作文自動評分仍有清楚的弱點。
AI 不會像老師那樣讀作文
AI 能處理大量文字,但它並不像人一樣閱讀作文。老師憑藉經驗、脈絡知識和對學生的了解,能讀出 AI 常常忽略的細微意涵。正如上面的研究所示,AI 和人可能給出相近的分數,理由卻不同,因為兩者對語文、內容和版面的權重不同。
偏差與公平
偏差是第二個問題。在同一項針對 1,768 篇國小三、四年級作文的研究中,Huang、Palermo 與 Wilson(2026)檢視了不同群體之間的公平性:不同性別、以英語為第二語言的學生,以及特殊教育學生。經過微調的 GPT-4o 整體最公平,但沒有任何模型完全消除了群體差異。
這不代表所有 AI 評分都同樣有偏差,而是代表任何系統在用於重要決定之前,都應該在不同學生群體和不同任務上接受檢驗。
分數往中間擠
AI 也傾向壓縮分數。老師會自然地使用整個分數區間,從很弱到很好;許多大型語言模型則會避開兩端。在 Zhou(2026)對 1,726 篇作文的研究中,模型呈現明顯的趨中傾向,很少給出評分規準中的最高等級。要區分一篇出類拔萃的作文和一篇只是不錯的作文,對這些系統來說很困難。
換成國寫的語言,就是 AI 最難判斷的,恰恰是 A+ 和 A 之間的那條線,而這往往正是高分作文拉開差距的地方。
同樣的規律也出現在大學。卡地夫大學與墨爾本大學的 Kay 等人(2026)讓兩個版本的 ChatGPT 批改 50 篇生物科學系大學部報告。整體分數常與人工評分接近,但細看每篇報告就不同了:AI 給較弱的報告打分偏高,給較好的報告打分偏低,在中間分數段吻合得最好。作者的結論是,生成式 AI 目前還無法可靠地批改篇幅較長的書面作業。
學生也可能試圖用不必要的長度、艱深詞彙或重複內容來「刷分」。好的 AI 評分應該依據評分規準和論證品質,而不是表面特徵。
放諸四海皆準的評語
分數可能是對的,評語卻沒什麼用。AI 有時會寫出看似有用、其實放在任何一篇作文上都成立的評語,例如「內容可以再具體一點」。與具體評量面向、具體段落連結,並在交還學生之前經過老師檢視與修改的評語,有用得多。
模型之間的差異
Jiao、Song 與 Lee(2026)在兩項寫作任務上比較了 GPT、Claude、Gemini 和 DeepSeek 系列的 10 個模型,發現它們在評分一致性與表現上有明顯差異。由於樣本較小,作者沒有替模型排名。
所以,「AI 批改」這幾個字本身說明不了太多。關鍵在於用的是哪個模型、怎麼設定、經過什麼樣的檢驗。
AI 可以直接給學生打成績嗎?
除了教學問題,也有規範層面的問題。
AI 的評分可以作為參考,但成績應由老師在檢視後決定。這不只是因為上面提到的準確度問題,也因為成績會影響學生的學習歷程與升學,老師必須能說明評分的理由。
學生作文可能包含姓名、家庭狀況等個人資料。蒐集、處理和利用這些資料時,應遵守《個人資料保護法》以及教育局(處)和學校的規定。
使用 AI 批改工具之前,學校應該先弄清楚:
- 作文儲存在哪裡、在哪裡處理?
- 作文會不會被用來訓練 AI 模型?
- 保存多久,能否完全刪除?
- 是否符合所屬教育主管機關和學校的相關規定?
日常可以做的簡單一步:上傳之前先刪除學生姓名等可辨識身分的資料。拿不準的時候,可以詢問學校的資訊或個資業務承辦人員。本節僅為一般性說明,不構成法律意見。
AI 能取代老師批改作文嗎?
AI 已經可以分擔一部分批改工作,尤其是快速初閱、標出常見問題,以及在大量作文中逐項核對評分規準。
但要完全取代人的判斷,就是另一回事了。理解細微之處、欣賞有創意或不落俗套的作文、質疑看起來不對勁的 AI 分數,都少不了老師。重要的評量,應該由老師決定。
把這些研究放在一起看,答案不是在 AI 和人之間二選一,而是人機協作。實際的問題是:哪項工作由誰來做更好?
- 草稿與修改: AI 做初閱並提出修改建議,老師抽查。
- 平時作文練習: AI 依評分規準評分,老師檢視分數、修改評語後再交還。
- 段考、模擬考等重要評量: 老師閱讀並決定分數。AI 可以提示問題,但不定分。
- 有創意、不落俗套或落在臨界分數的作文: 老師讀完全文,尤其是可能拿最高分與最低分的作文。
想具體比較各種工具,可以參考我們的〈教師最佳 AI 作文批改工具比較〉。
作文自動評分的未來
研究者正嘗試用更好的評分規準、提示詞和標準卷,縮小 AI 與人工評分之間的差距。
Choi、Tate 與 Warschauer(2026)在《Assessing Writing》期刊發表的研究顯示,在提示詞中加入「錨定範文」,也就是已經評好分數的範例作文,能大幅提高大型語言模型與人工評分的一致度,使其接近兩位人工評分者之間的一致度。涵蓋整個分數區間的範文,比只涵蓋部分等級的範文效果更好。GPT-4o 表現最佳,而 GPT-4o mini 以低得多的成本達到相近的結果。
對老師來說,這個發現既實用又熟悉。大考中心在國寫正式閱卷前,也會從 A+、A、B+、B、C+、C 六個等級選出標準卷,並舉行試閱會議凝聚評分共識。給 AI 幾篇從低分到高分、涵蓋整個分數區間的已評範文,是讓 AI 的分數更接近你的評分最簡單的方法之一。
研究者也在探究 AI 如何得出分數:它重視哪些文本特徵、這些權重會不會隨學生程度改變,以及結果對各個學生群體是否公平。針對中文作文的研究也還需要更多。光是給分快並不夠,AI 評分要真正有用,必須能促進學習,並經得起獨立檢驗。
關於作文自動評分的常見問題
什麼是作文自動評分?
它是一種閱讀作文、並依照既定標準或評分規準給分的軟體。早期系統主要計算語言特徵,現在的系統則使用能直接理解老師評分規準的大型語言模型。它是評量工具,而不是錯別字檢查工具,不過很多產品兩種功能都有。
AI 批改作文是怎麼運作的?
系統閱讀作文,逐項對照評分規準,提出建議分數,通常還會附上各面向的評語。使用大型語言模型時,你提供的評分規準和已評分的範例作文,會在很大程度上決定結果。清楚具體的評分規準,比模糊的規準更能得到一致的分數。
AI 替作文打分數準嗎?
取決於模型、評分規準和文體。在 1,768 篇國小三、四年級作文中,經過微調的 GPT-4o 最接近人工評分(Huang、Palermo 與 Wilson,2026)。在 8 個大型語言模型評分的 1,726 篇作文中,人工評分者區分弱作文與好作文的能力大約是 AI 的兩倍(Zhou,2026)。請把 AI 的分數當作初閱,並加以檢視。
AI 能批改學測國寫嗎?
AI 可以依國寫的評分原則提供估計分數和修改回饋,適合用來練習。但正式的學測國寫由大考中心的閱卷委員評分,每份試卷至少經過兩位委員獨立評閱。請把 AI 的分數當作練習時的參考,而不是正式成績的預測。
學生能騙過 AI 批改嗎?
有時可以。有些模型比人工評分者更重視語言的複雜程度,所以長句和艱深詞彙可能會拉高分數。明確給論據和論證加分的評分規準,能減少「灌水」的空間;分數高於預期的作文,老師最好抽查。
把學生作文上傳給 AI 安全嗎?
要看工具。先弄清楚作文儲存在哪裡、會不會被拿去訓練 AI 模型、保存多久。遵守《個人資料保護法》和學校的相關規定,上傳前刪除學生姓名等個人資料。
作文自動評分有哪些缺點?
AI 評分可能在不同學生群體之間出現公平性差異,對某些作文的評量也可能與老師不同。它難以評斷特別弱和特別好的作文,傾向把分數集中在中間。它也可能給出看似有用、卻沒有針對這篇作文的籠統評語。
AI 批改能提升寫作能力嗎?
如果學生用 AI 回饋來修改作文,就有可能提升。效果來自落實關於論點、論據與結構的評語。目標應該是讓思路更清晰,而不是寫出討 AI 喜歡的文章。
結語
作文自動評分可以替老師節省時間,讓學生更快得到回饋,但仍有限制。AI 在平均上可能與老師一致,卻分辨不出弱作文與優秀作文之間的差別,對不同學生群體的評量也可能不一樣。
最好的做法是:用 AI 做初閱和修改回饋,把最後的評分留給老師。想看看用你自己的評分規準做逐項初閱是什麼樣子,可以免費試用 Clasa。