AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 論文執筆・査読・学術コミュニケーション
査読(ピアレビュー)代行・支援
Peer review assistance / substitute reviewing
2030年(予測): 3/5 実務品質(要確認)
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
LLM査読者は弱い論文への評価を過大評価する体系的バイアスを持ち、strengths/weaknessesの重視点も人間(新規性・明確さ重視)とAI(実証的厳密さ・実装重視)で乖離することが報告されている。2026年のICLRでは査読の約21%がAI生成と推定され、信頼性が大きな論点になった。
できること
査読コメントの下書き、フォーマットチェック、明白な技術的欠陥(統計手法の誤り等)の指摘、大量の投稿の一次スクリーニングを高速に行える。
まだできないこと
論文の概念的新規性・学術的インパクトの評価では人間査読者と体系的に乖離する。守秘義務違反となる無断でのAIへの論文アップロードが横行し、NeurIPS/ICMLは隠しプロンプトの罠を仕掛けて摘発するほど問題化しており、信頼できる独立査読者としては機能していない。
なぜそうなのか
査読の核心は分野の暗黙知に基づく価値判断であり、LLMは表層的な指示への追従度が高く評価基準の一貫性を欠く。また守秘性の要求とクラウドAPIの利用は構造的に緊張関係にある。
これからの予測の根拠
学会側の検出・規制強化と査読支援ツールの適正化ルール整備が進めば、2027年には「開示付き補助」としての実務利用が定着すると予測するが、独立査読者としての信頼性確立は見通せないため3で頭打ちとした。
いま使える主な道具
GPT-5.x、Claude Fable 5.1、Pangram (AI検出/監視用)
根拠
- When Your Reviewer is an LLM: Biases, Divergence, and Prompt Injection Risks in Peer Review 2025
LLM査読者のバイアス・人間との評価観点の乖離を定量分析 - Pangram Predicts 21% of ICLR Reviews are AI-Generated 2026
ICLR2026査読の相当割合がAI生成と推定される調査 - Pushback on use of hidden prompts to snare AI peer reviews 2026
学会が隠しプロンプトでAI査読を摘発する運用とその論争
同じ分野のほかの仕事(論文執筆・査読・学術コミュニケーション)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。