AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 自己検証・信頼性
事実誤り(幻覚)の発生率
Factual hallucination rate
3/52026年: 実務品質(要確認)
2030年(予測): 5/5 専門家超え
2030年(予測): 5/5 専門家超え
02022
12023
22024
32025
32026
42027予
42028予
52030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
引用・事実確認においてはファクトチェッカーの正確性に及ばないが、一般的な質問応答では2024年基準の15-45%から2026年の3-19%まで改善
できること
一般知識質問応答では2026年フロンティアモデルで4.6-6.1%程度の幻覚率(Claude Haiku 4.5〜GPT-5.4-mini)
まだできないこと
引用生成タスクは依然弱く、拡張思考を使っても平均12.4%が幻覚。ゼロにはならず、単一の『幻覚率』という数字自体が誤解を招く
なぜそうなのか
モデルはタスクファミリー・推論設定により幻覚率が3.1%〜19.1%までばらつき、測定手法自体も標準化されていない
これからの予測の根拠
2024年比で大幅改善が続いているが、引用など特定タスクでの改善は鈍い。2028年までにゼロにはならず『検証必須』の運用が続くと予測
いま使える主な道具
Claude Haiku/Sonnet/Opus、GPT-5.4
根拠
- AI Hallucination Rate Benchmarks 2026: 5-Model Study 2026
5モデルの幻覚率が4.62%〜6.10%、引用タスクは12.4%と特に悪い - LLM Hallucination Statistics 2026 2026
タスク別の幻覚率のばらつきを整理
同じ分野のほかの仕事(自己検証・信頼性)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。