AIによる作文の自動採点はどこまで正確?最新研究でわかった実力と限界

作文の自動採点とは、AIが作文や小論文を読み、ルーブリック(評価規準・採点基準)と照らし合わせて、数秒で点数とコメントを返す仕組みです。2026年の研究では、AIが一部の課題で人間の採点者とかなり近い点数をつけられることが示されています。一方で、AIは人間とは違う観点を重視し、とても弱い作文やとても優れた作文の評価を苦手とします。そのため教員にとっては、教師の採点を置き換えるものではなく、「一次採点」や書き直しの支援として使うのが最も効果的です。
Clasaはルーブリックに基づくAIエッセイ採点ツールを開発しています。だからこそ、自社ツールを基準にするのではなく、独立した研究を引用しながら、この分野の研究を注意深く追っています。この記事では、AIによる作文採点について最新の研究が実際に何を示しているのか、そして日本の学校にとって何を意味するのかを整理します。
作文の自動採点(AES)とは?
作文の自動採点(英語では Automated Essay Scoring、略してAES)とは、AI、機械学習、自然言語処理を使って、あらかじめ決めた基準やルーブリックに沿って文章を評価する技術です。システムが点数を提案するので、教員はすべての答案の一次採点を手作業で行わずに済みます。ツールによって、表記や文法、語彙、構成、内容、課題への応答の度合いなどを評価します。
自動採点は新しい技術ではありません。1960年代にはすでにProject Essay Grade(PEG)がコンピューターで文章を分析しており、米ETSのe-raterは数十年にわたって英語の作文評価に使われてきました。最近のシステムはニューラルネットワークや大規模言語モデル(LLM)を使っているため、表面的な言語の特徴だけでなく、文章の意味や詳細な評価基準を扱えるようになっています。
つまり、現在のAI採点は単語を数えたり誤りに印をつけたりするだけのものではありません。作文の複数の側面を同時に評価できるので、よく混同されるツールと区別しておくと役に立ちます。
| ツール | 主な役割 | 提供するもの | 主な利用者 |
|---|---|---|---|
| 文章校正ツール | 言葉の誤りを見つける | 誤字脱字、文法、句読点、表現の修正候補 | 生徒や書き手 |
| 自動フィードバック(AWE) | 書き直しを助ける | 構成、表現、内容の展開についてのコメント | 生徒と教員 |
| 自動採点(AES) | ルーブリックに沿って採点する | 点数と、ツールによっては観点ごとのコメント | 教員や学校 |
違いは目的にあります。校正ツールは言葉の誤りを直し、自動フィードバックは書き直しを助け、自動採点は決められた基準で作文を評価して点数をつけます。
AIはどのように作文を採点するのか?
仕組みはモデルによって異なりますが、一般にAI採点は、言葉の使い方、構成、内容、ルーブリックの観点を組み合わせて判断します。
表記・文法と語彙
AIは誤字、句読点の誤り、不適切な語の選択を確実に見つけられ、これは言語運用力を見るうえで役立ちます。しかし、文法が完璧でも、考えが浅かったり根拠がなかったりすれば、よい作文とはいえません。役に立つツールは、文章の表面より深いところまで見る必要があります。
構成と一貫性
AIは、文章のまとまりも評価できます。序論でテーマを示しているか、段落が論理的な順序で並んでいるか、結論が主張に立ち返っているか、といった点です。
これは生成AIが比較的得意とする分野です。Huang、Palermo、Wilson(2026)は、小学3・4年生にあたる児童の作文1,768件を分析し、指示文(プロンプト)を工夫したGPT-4oが、構成や文体の評価で人間の採点者に近づいたことを報告しています。一方、従来型の特徴量ベースの採点システムは、内容の展開や表面的な特徴の評価で人間とよく一致しました。
内容と論証
文章の中身を評価するのはもっと難しくなります。意見を述べるだけでは足りず、それを展開し、根拠で支える必要があります。LLMもルーブリックを使えばこうした点を評価できますが、その判断は人間の読み手と異なることがあります。
Wang、Chen、Huang、Lai(2026)は、英語を母語としない書き手の英作文について、Qwen、GPT、Geminiを人間の採点者と比較しました。モデルは文法の正確さ、語彙、文の複雑さを重視しました。人間は内容がそろっているかをより重視し、見た目のわかりやすさにも目を配り、小さな言葉の誤りには寛容でした。また、人間の採点は生徒の習熟度が変わっても安定していました。
課題とルーブリックへの適合
しっかりしたAI採点は、生徒が課題に正面から答えているかも確認します。ルーブリックが「根拠を挙げて主張を説明すること」を求めていれば、AIはまさにその点を採点できます。
ルーブリックが重要なのは、AIが「よい作文」とは何かを独自に知っているわけではないからです。AIが知っているのは、与えられた観点だけです。だからこそ、ルーブリックに基づく採点が現在のAI評価の中心になっています。
たとえば教員が「根拠の示し方」という観点を設定すると、AIは主張が適切な具体例や資料で支えられているかを確認します。まだルーブリックがない場合は、無料のAIルーブリック作成ツールで課題から作成できます。手順はルーブリックの作り方で詳しく解説しています。
| ルーブリックの観点 | AIが見るポイント | コメント例 |
|---|---|---|
| 根拠の示し方 | 主張を支える適切な具体例や資料があるか | 「主張ははっきりしていますが、第2段落ではそれを支えるもっと説得力のある根拠が必要です。」 |
つまりAIは、作文が「それらしく聞こえるか」を判断しているのではありません。教員が決めた具体的な観点に照らして確認しているのです。
作文の自動採点はどこまで正確か?
本当の問題は、AIの点数が教員の点数に十分近く、実際に役立つかどうかです。研究によれば、役立つ場合はあります。ただし、精度はモデル、生徒、課題、そして精度の測り方によって変わるという重要な前提がつきます。
まず注意点があります。AI採点の研究の多くは英語圏で行われており、ここで紹介する海外の研究も英語の文章を対象にしています。日本語の作文や小論文で同じ結果になるかは、まだ十分に検証されていません。結果は目安として読んでください。
Huang、Palermo、Wilson(2026)は、小学3・4年生相当の作文1,768件で、GPT-4oと従来型の特徴量ベースの採点システムを比較しました。プロンプトを工夫したGPT-4oは、人間と従来型システムの一致度に近づき、課題に合わせて追加学習(ファインチューニング)したGPT-4oが最も高い精度を示しました。それでも、生徒のグループ間の差が完全になくなったモデルはありませんでした。
Zhou(2026)は、8種類のLLMが採点した作文1,726件を、信号検出理論という手法で分析しました。これは、採点者が弱い作文と強い作文をどれだけ見分けられるかを測る方法です。人間の採点者は、その見分ける力がAIのおよそ2倍でした。LLMは点数を尺度の中ほどに集め、ルーブリックの最上位の評価をめったにつけませんでした。
この2つの結果は矛盾しません。「一致度」は、AIと人間の点数が全体としてどれだけそろうかを測ります。ほとんどの作文は中間の点数に集まるので、AIはそこではそれなりに健闘します。一方「識別力」は、弱い作文と優れた作文を見分けられるかを測るもので、AIが弱いのはまさにこの点です。
国内の研究:中高生の英語記述問題
日本の学校現場に近いデータを使った研究もあります。日本教育工学会の研究報告集に掲載されたジョシュクンらの研究(2026)は、中学生・高校生の英語記述問題の手書き答案7,721件をOCRでテキスト化し、生成AIの採点と人間の採点を比較しました。
その結果、両者の差が±1点以内に収まった割合は全体で83%を超え、一部の問題では90%以上に達しました。AIと人間の差は、人間の採点者どうしのばらつきと同程度かそれ以下でした。
ただし、対象は英語の短文から中程度の長さの記述問題で、日本語の長い作文や小論文ではありません。また、東京大学大学院と民間企業による共同研究です。それでも、「AIが一次採点を担い、人間が確認する」という使い方が現実的になりつつあることを示す結果です。
人間の採点者どうしも一致しない
採点が完璧でないのは人間も同じです。2019年、文部科学省は大学入学共通テストへの国語・数学の記述式問題の導入を見送りました。当時の萩生田文部科学大臣の会見では、採点体制を強化しても「採点ミスを完全になくすところまで至るには限界がある」こと、2度の試行調査で国語の約3割の受験生の自己採点が実際の採点結果と一致しなかったことが説明されました。
大量の記述答案を短期間で公平に採点するのは、人間にとっても難しい課題です。そのため問うべきなのは、AIが「正しい点数」を出せるかではなく、もう一人の人間の採点者と比べて誤りが多いのか、あるいは違う種類の誤りをするのか、という点です。上の研究によれば、AIの誤りは種類が違います。点数を中ほどに集め、内容より形式を重視しがちです。
人間とAIが重視するもの
| 評価の対象 | 人間の採点者の傾向 | AIの傾向 | 先生にとっての意味 | 出典 |
|---|---|---|---|---|
| 文法、語彙、文の複雑さ | 小さな誤りには寛容 | これらをより重視する | 表現は整っているが中身の薄い作文が、AIでは高く評価されることがある | Wang et al. (2026) |
| 内容がそろっているか | 大きく重視する | 言語面より軽く扱う | 作文が課題に本当に答えているかを確認する | Wang et al. (2026) |
| とても弱い作文と優れた作文 | 尺度全体を使う | 点数を中ほどに集め、満点をめったにつけない | 最上位・最下位になりそうな作文は自分で読む | Zhou (2026); Kay et al. (2026) |
| 構成と文体 | 基準となる | 工夫したプロンプトのGPT-4oは小学3・4年生相当で人間に近かった | 構成についてのコメントの一次案としては妥当 | Huang et al. (2026) |
「安定している」と「正確」は別のこと
| 用語 | 意味 |
|---|---|
| 信頼性 | 同じ作文に毎回どれだけ一貫した点数をつけるか |
| 正確さ | 熟練した採点者の点数など、信頼できる基準にどれだけ近いか |
| 妥当性 | 点数が、ルーブリックで測ろうとしている書く力を本当に測っているか |
| 公平性 | 異なる生徒のグループを同じようにうまく評価できるか |
これらの言葉は混同されがちですが、測っているものは違います。毎回同じ点数をつけるシステムでも、毎回同じように間違っていることがあります。
Debelak、Ziegler(2026)は、4つすべてを確認すべき理由を示しています。PLOS Oneに掲載された方法論の論文で、公開されている英語作文のデータセット「Hewlett ASAP」で学習したDistilBERTモデルを検証したところ、Spearman-Brown係数0.77〜0.92という高い内的一貫性と妥当性の根拠が見られました。しかし、作文のテーマごとに人間とAIの点数を比べると、公平性に欠ける兆候も見つかりました。結論は、信頼性・妥当性・公平性はあわせて評価しなければならない、というものです。
AI採点は生徒の書き方を変えるか?
AIは評価を変えつつあり、もしかすると書くこと自体も変えているかもしれません。これまでは「書く、提出する、返却を待つ」という流れでした。AI採点ツールを使えばフィードバックがすぐに返ってくるため、「書く、コメントを受け取る、書き直す、もう一度確かめる」という速いサイクルが生まれます。
これは形成的評価にとって大きな価値があります。生徒は弱い主張やつながりの悪い段落をAIに指摘してもらい、教員に提出する前に下書きを直せます。AIのフィードバックが最も役立つのは、提出後ではなく書き直しの段階です。
ただし、リスクもあります。AIが特定の語彙や構文を高く評価すると生徒が気づけば、機械に向けて書くようになり、型にはまった、自分の考えの少ない文章が増えるおそれがあります。
日本語でいえば、難しい漢語を並べた文章がその典型です。機械向けの文は、たとえば「教育的枠組みにおける技術統合の多面的含意は、包括的評価の必要性を惹起する。」のようになります。読み手に向けた文なら「学校は、AIで成績をつける前に、まずそのツールを試すべきだ。」です。Wangらの研究(2026)では、モデルが人間の採点者より語彙や文の複雑さを重視していたため、前者のほうがAIの点数は高くなるかもしれません。それでも、どの先生も後者を選ぶはずです。
AIのフィードバックは、文章をより明快にするためのもので、もったいぶった文章にするためのものではありません。生徒にとって一番効果があるのは、主張、根拠、構成についてのコメントを生かすことです。難しい言葉で点数が上がったら、それは目標ではなく警告のサインだと考えるようにしましょう。
教員にとっての自動採点のメリット
作文や小論文の課題を出すたびに、週末が採点で消えてしまう先生も多いのではないでしょうか。AI採点の主なメリットは、時間の節約、ぶれの少ない一次採点、そして素早いフィードバックです。AIは大量の答案に目を通し、クラス全体に共通する課題を見つけ、生徒が書き直しに使えるコメントを返せます。
自動採点システムは、100枚目の答案も1枚目と同じ基準で採点するので、長時間の採点でつい基準がずれていくことを抑えられます。ただし、一貫していることと公平であることは違います。偏ったシステムは、一貫して偏った採点をします。
すぐに返ってくるフィードバックは、課題の途中にいる生徒の助けになります。学校にとっては、すべての提出物に人間の読み手を割り当てなくても、一次採点を行き渡らせることができます。ツールや授業での活用法をより広く知りたい方は、教育におけるAI採点のガイドもご覧ください。
AIの最もよい使い方は、教員を置き換えることではなく、支えることです。一次採点、書き直しのためのコメント、ルーブリックに沿った一貫したチェックはAIに任せ、先生は一人ひとりに必要な個別の指導に時間を使えます。結果を確認し、最終的に判断するのは教員です。
ルーブリックに基づくAI採点を試してみたい方は、Clasaを無料で試してみてください。作文とルーブリックをアップロードすると観点ごとの採点結果が届き、生徒に返す前にコメントを確認・編集できます。
作文の自動採点が苦手なこと
大きく進歩したとはいえ、自動採点にはまだはっきりとした弱点があります。
AIは教師と同じようには読まない
AIは膨大な量の言語を処理できますが、人間のように作文を読むわけではありません。教員は経験や文脈、クラスの生徒についての知識をもとに、AIが見落としがちな細かなニュアンスを読み取ります。上の研究が示すように、AIと人間は言葉、内容、見た目の重みづけが違うため、似た点数でも理由が異なることがあります。
偏りと公平性
もう一つの問題は偏りです。Huang、Palermo、Wilson(2026)は、同じ1,768件の作文で、性別、英語を第二言語として学ぶ児童、特別支援教育の対象児童といったグループ間の公平性を調べました。追加学習したGPT-4oが全体として最も公平でしたが、グループ間の差が完全になくなったモデルはありませんでした。
すべてのAI採点が同じように偏っているわけではありません。しかし、成績など重要な判断に使う前に、異なる生徒のグループや課題で検証すべきだということは確かです。
点数が中ほどに集まる
AIは点数を中ほどに縮める傾向もあります。教員は「とても不十分」から「とても優れている」まで尺度全体を使いますが、多くのLLMは両端を避けます。Zhou(2026)の1,726件の研究では、モデルに強い中心化傾向が見られ、ルーブリックの最上位の評価はめったにつけられませんでした。飛び抜けた作文と、単によい作文を見分けるのは、こうしたシステムにとって難しいのです。
観点別評価でいえば、「A」をつけるべき作文を見極める場面こそ、AIが最も頼りにならない場面だということです。
同じ傾向は大学でも見られます。カーディフ大学とメルボルン大学のKayら(2026)は、2つのバージョンのChatGPTに生物科学系の学部生のレポート50本を採点させました。全体の点数は人間の採点者に近いことが多かったものの、個々のレポートでは違いが出ました。AIは弱いレポートを高く、優れたレポートを低く採点し、中位の範囲で最もよく一致しました。著者らは、生成AIはまだ長い文章を信頼できる形で採点できないと結論づけています。
生徒が、不必要に長い文章や難しい語彙、同じ内容の繰り返しでAIを「攻略」しようとすることもあります。よいAI採点は、表面的な特徴ではなく、ルーブリックと論証の質に基づいて評価すべきです。
どの作文にも当てはまるコメント
点数は正しくても、コメントが役に立たないことがあります。AIは「もっと詳しく書きましょう」のように、一見役立ちそうでも、どの作文にも当てはまるコメントを書くことがあります。具体的な観点や本文の具体的な箇所に結びつき、生徒に返す前に教員が確認・修正したコメントのほうが、はるかに役立ちます。
モデルによる違い
Jiao、Song、Lee(2026)は、GPT、Claude、Gemini、DeepSeekの各系統から10のモデルを2つの作文課題で比較し、採点の一貫性や性能に大きな違いがあることを見いだしました。ただしサンプルが小さかったため、著者らはモデルの順位づけを控えています。
つまり「AIで採点した」というだけでは情報が足りません。どのモデルを、どのように設定し、どう検証したのかが重要です。
AIが成績をつけてもよいのか?
教育上の問題に加えて、ルールの問題もあります。
文部科学省の「初等中等教育段階における生成AIの利活用に関するガイドライン(Ver.2.0)」(2024年12月)は、不適切と考えられる例として、「児童生徒の学習評価を、教師が判断せずに生成AIからの出力をもって行う」ことや、教師が正確な知識に基づいてコメント・評価すべき場面で生成AIの出力だけに頼ることを挙げています。AIの採点はあくまで参考であり、評価を決めるのは教師です。
同じガイドラインは、個別の契約などで適切なセキュリティ対策がとられた環境で運用している場合を除き、成績情報のような重要性の高い情報をプロンプトに入力してはならないとしています。生徒の作文には、氏名から家庭のできごとまで個人情報が含まれることがあります。個人情報保護法などの関係法令に加え、教育委員会や学校の情報セキュリティポリシーに従う必要があります。
AI採点ツールを使う前に、次の点を確認しましょう。
- 作文はどこに保存され、どこで処理されるか
- 作文がAIモデルの学習に使われるか
- どのくらいの期間保存され、完全に削除できるか
- 教育委員会や学校の方針で利用が認められているか
日常でできる簡単な対策は、アップロードする前に氏名など本人を特定できる情報を消しておくことです。判断に迷うときは、学校の情報セキュリティ担当者や管理職に相談してください。このセクションは一般的な目安であり、法的助言に代わるものではありません。
AIは採点する先生の代わりになるか?
AIはすでに採点の一部を担えます。特に、素早い一次採点、よくある問題の指摘、大量の答案でのルーブリックの観点チェックです。
しかし、人間の判断を完全に置き換えるとなると話は別です。ニュアンスを読み取り、独創的な答案や型破りな答案を評価し、おかしく見えるAIの点数を疑うためには、教員が欠かせません。重要な判断は、教員が下すべきです。
研究をあわせて読むと、AIか人間かの二者択一ではなく、両者の協働が見えてきます。現実的な問いは、どの作業をどちらが得意とするかです。
- 下書きと書き直し: AIが一次採点をしてコメントを提案し、教員は抜き取りで確認する。
- 授業内の評価課題: AIがルーブリックで採点し、教員が点数を確認してコメントを直してから返す。
- 定期考査や成績に大きく関わる評価: 教員が読んで判断する。AIは気になる点を示せるが、点数は決めない。
- 独創的な作文、型破りな作文、境界線上の作文: 教員が全文を読む。特に最上位・最下位になりそうな作文。
具体的なツールを比べたい方は、教師向けベストAIエッセイ採点ツールの比較記事をご覧ください。
作文の自動採点のこれから
研究者は、AIと人間の採点の差を縮めるために、よりよいルーブリック、プロンプト、アンカー作文を試しています。
Choi、Tate、Warschauer(2026)は、学術誌 Assessing Writing で、採点済みの見本である「アンカー作文」をプロンプトに加えると、LLMと人間の採点の一致度が大きく上がり、人間の採点者2人の一致度に近づくことを示しました。一部の段階だけでなく、尺度全体をカバーするアンカーのほうが効果的でした。最も成績がよかったのはGPT-4oですが、GPT-4o miniもはるかに低いコストで同等の結果を出しました。
これは先生にとって実践的で、なじみのある発見です。校内で採点基準をそろえるときに、評価済みの答案例を見ながら目線合わせをするのと同じ考え方です。AIに、低い評価から高い評価まで尺度全体の採点済みの例をいくつか渡すことは、AIの点数を自分の採点に近づける最も簡単な方法の一つです。
研究者は、AIがどのように点数を出しているのかも調べています。どの文章の特徴を重視しているのか、生徒の習熟度によってそれが変わるのか、どのグループにとっても公平な結果になっているのか、といった点です。日本語の作文や小論文を対象にした研究も、もっと必要です。速く点数が出るだけでは不十分で、AI採点が役立つためには、学びを支え、独立した検証に耐えるものでなければなりません。
作文の自動採点についてよくある質問
作文の自動採点とは何ですか?
作文を読み、決められた基準やルーブリックに沿って点数をつけるソフトウェアです。初期のシステムは言語の特徴を数えていましたが、現在のシステムは、教員のルーブリックを直接扱える大規模言語モデルを使います。校正ツールではなく評価のためのツールですが、両方の機能を備えた製品も多くあります。
AI採点はどのような仕組みですか?
システムは作文を読み、ルーブリックの観点ごとに照らし合わせて点数を提案し、多くの場合は観点ごとのコメントもつけます。大規模言語モデルでは、ルーブリックや、あなたが渡した採点済みの見本が結果を大きく左右します。あいまいなルーブリックより、明確で具体的なルーブリックのほうが一貫した点数になります。
AIの作文採点はどのくらい正確ですか?
モデル、ルーブリック、文章の種類によって変わります。小学3・4年生相当の作文1,768件では、追加学習したGPT-4oが人間の採点に最も近づきました(Huang、Palermo、Wilson、2026)。8種類のLLMが採点した1,726件では、弱い作文と優れた作文を見分ける力は人間のほうがおよそ2倍高い結果でした(Zhou、2026)。AIの点数は一次採点として扱い、必ず確認しましょう。
AIに成績をつけさせてもよいですか?
AIに点数を提案させることはできますが、成績を決めるのは教員です。文部科学省のガイドラインは、教師が判断せずに生成AIの出力で学習評価を行うことを不適切な例として挙げています。AIの採点結果は参考にとどめ、教員が自分で確認して判断してください。
生徒はAI採点をごまかせますか?
場合によってはできます。一部のモデルは人間の採点者より言葉の難しさを重視するため、長い文や難しい語彙で点数が上がることがあります。根拠と論証をはっきり評価するルーブリックにすれば水増しの余地は小さくなります。予想より点数が高い作文は、教員が抜き取りで読むとよいでしょう。
生徒の作文をAIにアップロードしても安全ですか?
ツールによります。作文がどこに保存されるか、AIモデルの学習に使われるか、どのくらいの期間保存されるかを確認してください。文部科学省のガイドラインや教育委員会の方針に従い、アップロードの前に氏名などの個人情報を削除しましょう。
作文の自動採点の欠点は何ですか?
生徒のグループ間で公平性に差が出たり、教員とは異なる評価をしたりすることがあります。とても弱い作文や優れた作文の評価が苦手で、点数を中ほどに集めがちです。また、一見役立ちそうでも、その作文には触れていない一般的なコメントを出すことがあります。
自動採点で作文力は伸びますか?
生徒がAIのフィードバックを使って書き直せば、伸びる可能性があります。効果が出るのは、主張、根拠、構成についてのコメントを生かしたときです。目指すべきは、AIに気に入られる書き方ではなく、より明快な考えです。
まとめ
作文の自動採点は、教員の時間を節約し、生徒に素早いフィードバックを返すことができますが、まだ限界があります。AIは平均的には教員と一致しても、弱い作文と優れた作文の違いを見落とすことがあり、生徒のグループによって評価が変わることもあります。
最善の方法は、一次採点と書き直しのためのフィードバックにAIを使い、最終的な成績の判断は教員に残すことです。自分のルーブリックで観点ごとの一次採点がどのようになるか見てみたい方は、Clasaを無料で試してみてください。