AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 論文執筆・査読・学術コミュニケーション

引用文献の妥当性チェック(幻覚引用対策)

Citation validity checking (hallucinated citation problem)

2/52026年: 補助
2030年(予測): 4/5 専門家並み
12022
12023
22024
22025
22026
32027予
32028予
42030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

2026年のPubMed分析では、掲載論文の277本に1本が実在しない参考文献を含み、これは2025年の458本に1本、2023年の2,828本に1本から急増した数字。AI利用の普及と時期的に一致している。

できること

検索拡張(RAG)により実在URLの引用生成の精度は改善しており、OpenAI Deep Researchのように幻覚率3.5%程度まで抑えたツールも存在する。

まだできないこと

撤回済み論文の検出さえ確実にはできない(2026年のJMIR研究)。Gemini系Deep Researchツールは幻覚率13.3%と高く、ツール間でばらつきが大きい。捏造引用は現実の論文出版で12倍(2年間)に急増しており、AI活用が問題を悪化させている側面が定量的に確認されている。

なぜそうなのか

LLMは「もっともらしい」文字列生成に最適化されており、参考文献の実在確認という外部検証ステップを内在的には持たない。撤回情報のような動的に更新されるメタデータの追跡も学習データの静的性質と相性が悪い。

これからの予測の根拠

個別ツールの改善(RAG精度向上)は続くが、現実の出版統計は悪化トレンドにあるため楽観的な予測を避け、2027-2028年も「実務品質未満・要全件確認」水準にとどまるとした。

いま使える主な道具

OpenAI Deep Research、Gemini Deep Research、citation-hallucination detection agents (arXiv 2605.08583等)

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(論文執筆・査読・学術コミュニケーション)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。