AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › マルチモーダル理解(画像/動画/音声/空間)
文書・画像理解(OCR/図表/帳票)
Document and image understanding (OCR/charts/forms)
4/52026年: 専門家並み
2030年(予測): 5/5 専門家超え
2030年(予測): 5/5 専門家超え
12022
22023
32024
42025
42026
42027予
52028予
52030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
OCR・帳票理解・図表読み取りは実務品質を超え、定型文書処理では専門家並みかそれ以上の速度・正確性
できること
複雑なレイアウトの請求書・契約書・グラフの数値抽出、手書き文字認識を含む高精度な文書理解が可能。DocVQAで94.75%(Qianfan-VL-70B)
まだできないこと
非定型・低品質スキャンや、文化依存的な文脈(古文書、専門記号)を要する解釈は専門家に劣る場面が残る
なぜそうなのか
文書理解は教師データが豊富で、視覚言語モデルの中でも最も成熟した応用領域の一つ
これからの予測の根拠
既に高水準のため2028年までの伸びは主に非定型文書・低リソース言語対応に限られる
いま使える主な道具
Claude vision、Gemini 3.1、Qianfan-VL、Qwen2.5-VL
根拠
- Qianfan-VL: Domain-Enhanced Universal Vision-Language Models 2025-09
DocVQA 94.75%、ChartQA 89.60%、OCRBench 873を達成 - Invoice OCR Benchmark: Extraction Accuracy of LLMs vs OCRs 2026
請求書処理でのLLMベース抽出精度を評価
同じ分野のほかの仕事(マルチモーダル理解(画像/動画/音声/空間))
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。