AIエージェント能力アトラス › 仕事ごとの一覧 › 専門職サービス › 医療(診断支援・画像読影・問診・治療計画)
鑑別診断支援
Differential diagnosis support
2030年(予測): 4/5 専門家並み
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
HealthBench Professional(70名超の医師作成・採点、2026-09時点): トップモデルGPT-6 Astra 63.4%、Claude Opus 5 59.8%(専門医レベル到達には及ばず)。HealthBench Hard(複雑臨床推論)ではGPT-5.4が40.1点と絶対値も低く複雑症例は依然困難。DeepRareは標準化症例で正診断1位提示57%。
できること
典型症例の鑑別リスト網羅的生成、稀な鑑別の想起支援(見落とし防止)、エビデンスに基づく追加質問生成
まだできないこと
複雑合併症例・非定型症例の確実な一次診断、責任を伴う最終診断確定、検査所見を動的に統合した判断
なぜそうなのか
難易度の高いベンチマーク(HealthBench Hard)で正答率4割程度。稀少・非定型症例で性能不安定。誤診が生命に関わるため免許制度上、医師の最終確認が必須。
これからの予測の根拠
マルチエージェント診断パイプラインや専門特化エージェントの精度向上ペースから2027-28年に典型内科系症例ではジュニア専門医超えが定着すると予測。HealthBench Hardが4割程度に留まることから専門家超え(レベル5)は2030年時点でも時期尚早と判断。
いま使える主な道具
AMIE、Med-Gemini、GPT-5.x/6、Claude Opus 5、DeepRare
根拠
- Harvey's Legal Agent Benchmark(参考: 同種の専門家ベンチマーク設計) 2026-09
HealthBench Professionalトップモデル63.4%、Claude Opus5 59.8%。専門医評価基準で満点に遠い - New AI Algorithm Could Speed Rare Disease Diagnoses 2026-04
DeepRare、標準化データで正診断上位1位57%的中、既存手法比+24pt - ChatGPT Medical Advice Lawsuit—What The Research Says About AI Diagnosis 2026-07
汎用チャットボットが肺塞栓症症状を誤って安心情報提供し続けた訴訟事例
同じ分野のほかの仕事(医療(診断支援・画像読影・問診・治療計画))
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。