AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 文献調査・サーベイ
幻覚引用・存在しない論文の捏造問題
Citation Hallucination & Fabricated References
2030年(予測): 4/5 専門家並み
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
人間の研究者は稀に誤引用をするが体系的な捏造は稀。対してDeep Research/LLMは商用システムで引用URLの3〜13%が幻覚、モデルによっては14〜95%の幻覚率という報告があり、専門家との差は依然大きい。
できること
検索連携(RAG)付きのシステムでは引用精度78%(OpenAI Deep Research)〜94%(検索付きClaude)まで改善されており、単純な事実確認や既知の著名論文の引用では実務利用に耐える水準に近づいている。
まだできないこと
査読前提の学術文献では致命的:NeurIPS 2025の分析では捏造引用の66%が『完全な捏造』(存在しない論文を丸ごと生成)であり、著者の41.5%がBibTeXを未確認でコピペ、17.3%がAI推薦論文を読まずに引用、査読者の76.7%が参照文献を十分確認していないという実態も判明。医学文献での捏造参照率は2023年の1/2828から2026年初頭には1/277まで悪化(約10倍)。
なぜそうなのか
LLMは『もっともらしい形式』の文字列生成に最適化されており、著者名・年・タイトルの組み合わせが学習分布上『ありそう』であれば実在確認なしに生成してしまう。検索接続(RAG)で改善するが、検索結果自体の要約時に再度幻覚が混入しうる。
これからの予測の根拠
検索接続・引用検証ツール(GhostCite等)の実用化が進んでいるが、捏造率の悪化トレンド(医学文献)も同時進行しており、2028年時点でも完全解消は見込めず『実務品質(要確認)』レベルへの改善に留まると予測。
いま使える主な道具
OpenAI Deep Research、Claude with search、Gemini Deep Research、GhostCite検出ツール
根拠
- Detecting and Correcting Reference Hallucinations in Commercial LLMs and Deep Research Agents 2026-04
商用Deep Researchで引用URLの3-13%が幻覚、精度は78%(OpenAI)〜94%(Claude+search) - Fraudulent citations, blamed on AI hallucinations, are becoming more common in research papers 2026-05
Lancet研究、医学文献の捏造参照率が2023年比で10倍以上に悪化 - Compound Deception in Elite Peer Review: A Failure Mode Taxonomy of 100 Fabricated Citations at NeurIPS 2025 2026-02
NeurIPS2025の捏造引用の66%が完全捏造 - AI hallucinations in research, legal filings, and books are growing and getting harder to fix 2026-05
著者・査読者の確認不足の実態データ(41.5%/17.3%/76.7%)
同じ分野のほかの仕事(文献調査・サーベイ)
- Deep Researchの網羅的調査・精度
- 複数論文の統合・比較(データ抽出含む)
- システマティックレビュー相当の再現性・PRISMA準拠
- 最新研究動向の把握・トレンド追跡
- Deep Researchの自律タスク遂行時間(task horizon)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。