AIエージェント能力アトラス › 仕事ごとの一覧 › 専門職サービス › 教育

記述式採点

Essay grading (constructed-response)

3/52026年: 実務品質(要確認)
2030年(予測): 4/5 専門家並み
12022
22023
22024
32025
32026
32027予
42028予
42030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

EssayGrader調査(2026-07、22,000本のエッセイ): 人間採点者との一致率94%(完全一致または1点以内)。8つの独立プログラム、3-12年生・AP全学年帯で一貫。ある認定プログラムでは20万件超の課題採点に利用。

できること

ルーブリックに基づく一貫した採点、大量答案の高速処理、フィードバックコメントの生成

まだできないこと

ルーブリック外の独創性・創造性の評価、文化的文脈依存の解釈、採点結果への異議申し立てへの説明責任(最終的に教員が負う)

なぜそうなのか

定型化されたルーブリック採点はAIの得意領域で既に高精度だが、教育評価の公平性・説明責任は制度上教員に帰属し続ける。

これからの予測の根拠

客観的採点は既にレベル4に到達し安定。創造性評価の主観的領域は技術的にもブレイクスルーが見込めずレベル4で頭打ちと予測。

いま使える主な道具

EssayGrader.ai、Turnitin、Gradescope AI

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(教育)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。