AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 記憶と文脈
長文脈からの検索・統合的推論
Long-context retrieval and integrative reasoning
3/52026年: 実務品質(要確認)
2030年(予測): 5/5 専門家超え
2030年(予測): 5/5 専門家超え
02022
12023
22024
32025
32026
42027予
42028予
52030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
単純な検索(needle-in-haystack)は人間を上回るが、複数情報の統合・矛盾解消を要する実務読解は専門家に劣る
できること
単一事実の検索は128K〜1Mトークン規模でほぼ完璧に近い精度を出す
まだできないこと
複数needle(多点情報の統合)では精度が95%から60%まで低下。全モデルでRULERスコアはNIAHスコアより10-25ポイント低く、実効文脈は主張スペックの200-400K程度に留まる(Gemini 3 Deep Think除く)
なぜそうなのか
文脈が長くなるほど関連性判定の精度が下がる『context rot』現象があり、単純検索と統合的推論の難易度差が大きい
これからの予測の根拠
アーキテクチャ改善(attention効率化)により2028年に実効文脈が主張値に近づくと予測されるが、需要も並行して伸びるためギャップが残る可能性
いま使える主な道具
Gemini 3 Deep Think、Claude (1M context)、GPT-5.x
根拠
- Long-Context Retrieval 2026: Needle-in-Haystack Test 2026
多点needleで精度95%→60%に低下、実効文脈は200-400K程度 - RULER: What's the Real Context Size of Your Long-Context Language Models? 2024-04
RULERスコアがNIAHスコアより大幅に低いことを実証
同じ分野のほかの仕事(記憶と文脈)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。