AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 文献調査・サーベイ

幻覚引用・存在しない論文の捏造問題

Citation Hallucination & Fabricated References

2/52026年: 補助
2030年(予測): 4/5 専門家並み
02022
02023
12024
12025
22026
32027予
32028予
42030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

人間の研究者は稀に誤引用をするが体系的な捏造は稀。対してDeep Research/LLMは商用システムで引用URLの3〜13%が幻覚、モデルによっては14〜95%の幻覚率という報告があり、専門家との差は依然大きい。

できること

検索連携(RAG)付きのシステムでは引用精度78%(OpenAI Deep Research)〜94%(検索付きClaude)まで改善されており、単純な事実確認や既知の著名論文の引用では実務利用に耐える水準に近づいている。

まだできないこと

査読前提の学術文献では致命的:NeurIPS 2025の分析では捏造引用の66%が『完全な捏造』(存在しない論文を丸ごと生成)であり、著者の41.5%がBibTeXを未確認でコピペ、17.3%がAI推薦論文を読まずに引用、査読者の76.7%が参照文献を十分確認していないという実態も判明。医学文献での捏造参照率は2023年の1/2828から2026年初頭には1/277まで悪化(約10倍)。

なぜそうなのか

LLMは『もっともらしい形式』の文字列生成に最適化されており、著者名・年・タイトルの組み合わせが学習分布上『ありそう』であれば実在確認なしに生成してしまう。検索接続(RAG)で改善するが、検索結果自体の要約時に再度幻覚が混入しうる。

これからの予測の根拠

検索接続・引用検証ツール(GhostCite等)の実用化が進んでいるが、捏造率の悪化トレンド(医学文献)も同時進行しており、2028年時点でも完全解消は見込めず『実務品質(要確認)』レベルへの改善に留まると予測。

いま使える主な道具

OpenAI Deep Research、Claude with search、Gemini Deep Research、GhostCite検出ツール

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(文献調査・サーベイ)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。