AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 速度・コスト・効率

推論速度・レイテンシ

Inference speed and latency

4/52026年: 専門家並み
2030年(予測): 5/5 専門家超え
22022
22023
32024
32025
42026
42027予
42028予
52030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

人間の思考速度と比べれば圧倒的に高速だが、複雑な推論(thinking mode)を使うと応答が数秒〜数十秒かかり、リアルタイム対話には課題が残る

できること

特化ハードウェア(Cerebras等)で981トークン/秒(フロンティアモデル)、小型モデルでは2,600トークン/秒超を実現。投機的デコーディング・連続バッチング等で大幅な高速化

まだできないこと

思考モデル(reasoning mode)は依然として数秒〜数十秒の遅延があり、体感速度はハードウェア次第で大きくばらつく(モデル選択より供給インフラの影響が大きい)

なぜそうなのか

2026年の速度改善は主にサービング基盤側(ルーティング、キャッシュ、量子化)の最適化によるもので、モデル自体の推論効率化と両輪

これからの予測の根拠

専用チップ(Cerebras、Groq等)の普及拡大で2028年までにさらに2-4倍の高速化が見込まれる

いま使える主な道具

Cerebras inference、vLLM/SGLang、Claude/GPT-5.x

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(速度・コスト・効率)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。