AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 記憶と文脈

長文脈からの検索・統合的推論

Long-context retrieval and integrative reasoning

3/52026年: 実務品質(要確認)
2030年(予測): 5/5 専門家超え
02022
12023
22024
32025
32026
42027予
42028予
52030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

単純な検索(needle-in-haystack)は人間を上回るが、複数情報の統合・矛盾解消を要する実務読解は専門家に劣る

できること

単一事実の検索は128K〜1Mトークン規模でほぼ完璧に近い精度を出す

まだできないこと

複数needle(多点情報の統合)では精度が95%から60%まで低下。全モデルでRULERスコアはNIAHスコアより10-25ポイント低く、実効文脈は主張スペックの200-400K程度に留まる(Gemini 3 Deep Think除く)

なぜそうなのか

文脈が長くなるほど関連性判定の精度が下がる『context rot』現象があり、単純検索と統合的推論の難易度差が大きい

これからの予測の根拠

アーキテクチャ改善(attention効率化)により2028年に実効文脈が主張値に近づくと予測されるが、需要も並行して伸びるためギャップが残る可能性

いま使える主な道具

Gemini 3 Deep Think、Claude (1M context)、GPT-5.x

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(記憶と文脈)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。