1 ポイント 投稿者 GN⁺ 1 시간 전 | 1件のコメント | WhatsAppで共有
  • NeurIPS、WACV、ECCV TerraBytesで査読した22本のうち 15本(68%) に、捏造された引用・著者リストや明らかなLLM生成文があり、偽の著者を報告した2本の論文も参考文献修正を条件に口頭発表に採択された
  • 2025年の学術文献には約 14万6,900件のハルシネーション引用 があったと推定され、bioRxivから出版版まで追跡したハルシネーション引用の85.3%は、査読を通過した後も残っていた
  • 問題は投稿を超えて査読にも広がっており、ICLR 2026のレビューの21%が完全なAI生成と判定され、ICML 2026ではLLM使用禁止対象の査読者が書いたレビュー約 795件 でLLM使用が検出された
  • LLM使用そのものよりも 検証していない結果の提出 が問題であり、参考文献の誤り、本文と表の数値不一致、過度な成果アピール、指標だけを繰り返す考察セクションは、原稿が十分に検討されていないサインになる
  • 参考文献を複数の登録機関と照合する bib-audit が公開されたが、非公開投稿論文の一部をホスト型LLMに送るため、査読者は学会ごとの機密性とLLMポリシーを先に確認する必要がある

22本を査読して確認した規模

  • 2人の査読者が夏の間、NeurIPS、WACV、ECCVの地理空間ワークショップ TerraBytes で計 22本 を査読した
    • 15本(68%)で、完全に捏造された引用、実在論文の改変された著者リスト、ハルシネーションされた専門用語・意味不明な文・無関係な引用など、明らかなLLM生成の痕跡を発見した
    • ある査読者は11本中6本(55%)、もう一人は11本中9本(82%)でこうした問題を確認した
  • 学会別の結果は以下のとおり
    • NeurIPS Datasets and Benchmarksトラック:5本中2本
    • NeurIPS Position Paperトラック:2本中2本
    • TerraBytes:それぞれ2本中1本、5本中4本
    • WACV:2人の査読者とも4本中3本
  • 引用問題だけでデスクリジェクトに相当する論文は、それぞれ5本と9本だった
    • WACV論文2本は、参考文献の 最初の項目 から実在論文の著者を偽名に置き換えていた
    • NeurIPS論文1本は、ハルシネーションまたは意味不明な専門用語が53ページにわたっており、参考文献の検討自体が無意味だった
    • NeurIPS Position Paperの2本はいずれもLLM生成物と判断され、TerraBytesで割り当てられた論文5本中4本にも偽の引用や著者があった

学術文献全体に広がったハルシネーション引用

  • 2026年4月の Nature分析 は、2025年の出版物少なくとも数万本に、誤ったAI生成参考文献が含まれていた可能性を確認した
  • ZhaoらによるarXiv・bioRxiv・SSRN・PubMed Central監査 は、2025年だけで約 14万6,900件 のハルシネーション引用があったと推定した
    • 少数の悪意ある行為者に集中していたのではなく、多くの論文に薄く広がっていた
    • キャリア初期の研究者や小規模チームで含まれる可能性が最も高かった
    • ハルシネーション引用を含むbioRxivプレプリントの出版版を追跡した結果、85.3% がそのまま残っていた
  • The Lancetによる生物医学論文250万本の監査 では、偽の参考文献が1件以上ある論文の割合が2年で6倍に増えた
    • 2023年の2,828本に1本から、2025年には458本に1本へ増加
    • 2026年初頭には277本に1本に達した
  • NeurIPS 2025出版論文のハルシネーション引用100件の分析 では、すべての引用が3〜5人の専門家レビューを通過していた
    • それらの引用を含む論文は53本で、全採択論文の約 1% であり、現在もプロシーディングに残っている

AIが書くピアレビューと操作可能性

  • PangramのICLR 2026分析 は、レビュー15,899件、つまり 21% が完全にAI生成だったと判定した
    • 全レビューの半分以上には、何らかの形でAIが関与していた
  • Organization Scienceでは、ChatGPT登場後に投稿が 42%増加 し、現在のピアレビューの30%以上で一定程度のAIが使われていると測定された
  • ICML 2026のプロンプトインジェクション検出 では、LLM使用が禁止されたPolicy A査読者506人が書いたレビュー約795件でLLM使用を発見した
    • これは全レビューの約1%に相当する
    • NeurIPSでも、明らかなAI生成の倫理レビューや複数のAI生成反論文が観察された
  • AIレビューは、論文の科学的内容を変えずに アブストラクトを敵対的に書き換える だけで評価を上げられる
    • Liらの実験 で最も強力な攻撃は約38%の成功率を記録した
    • 10点満点で、Gemini 3 Flash査読者の採択スコアは1.31点、GPT 5.4 Mini査読者のスコアは0.88点高くなった
    • 攻撃者はどのレビュー用モデルが使われるかを知る必要もなかった

実際の査読で見つかった捏造と判別シグナル

  • 最悪の事例は、実在論文の学会・タイトル・他の著者は維持しつつ、個人的に知っている著者だけを似た架空名に置き換えた2本の投稿だった
    • 査読者がリジェクトを勧告し、主催側に直接報告したが、2本とも 参考文献修正を条件とする口頭発表 として採択された
  • SatMAEを引用したWACV論文は、著者を “Yuyang Cong, Saurabh Khanna, Chen Meng, et al.” と記していた
  • 53ページと40ページのNeurIPS論文には、ハルシネーション専門用語と捏造された参考文献があり、ある論文は複数の引用の横に LLMの内部メモ まで残していた
  • 偽の著者と完全に偽の参考文献は、どちらも原稿が十分に検討されていないことを示している
    • その研究を実際に読んだのか、正しい文脈で引用したのか、論文・コード・データセットの他の部分も信頼できるのかが不明になる
    • ハルシネーション参考文献がある論文は採択準備ができていないため、デスクリジェクトすべきだという立場だ
  • LLMが書いた可能性が高いシグナル

    • よくある文体上のシグナルとして、“It’s not X, it’s Y”、“The real X is Y” のような対比表現、過度な 太字・em dash、解釈しづらい高密度の文、結果に対する過剰な宣伝がある
    • より微妙なシグナルは、本文中の数値や指標が表と一致しない場合である
    • 実験を再実行した後、エージェントに全数値の更新や検証を指示しないと、こうした不一致が生じる
    • Claudeは、付録やコードに回すべき数値まで本文に圧縮し、考察セクションで表の指標だけをそのまま繰り返す傾向がある
    • 平均・標準偏差なしで1%未満の改善をSOTAと呼ぶカスタムモデル、引用で十分な箇所に入った複雑な数式、付録にあるべきアブレーション実験も警告シグナルである

査読業務に生じた変化

  • アブストラクトを読んだ直後に 参考文献からざっと確認 し、論文全体がLLM出力かどうかを素早く確認する方式へ、査読手順が変わった
  • LLMの痕跡を探す時間が増え、論文が善意で提出されたという前提も弱くなった
    • 興味深く、人間が書いた読む価値のある論文の数が大きく減ったと感じる
    • ただし、ハルシネーション参考文献を除けば、従来の低品質な人間執筆論文を査読する際と似た問題も多い
  • LLM使用の事実そのものは査読基準ではない
    • LLMが執筆を支援していても、研究が興味深く、実験が有効で再現可能であれば問題はない
    • 検討していないLLM出力をそのまま提出し、査読者にフィードバックを求める行為が問題である
  • 学会が投稿者に4〜5本のレビューを義務化することで、無償の査読量も増えている
    • 査読者は夜間や週末に時間を割いて査読しており、引用のハルシネーションを後から発見すると、その時間が無駄になる
    • レビューから学ぶには、研究者がまず自分の仕事を十分に読み、内省する必要がある

LLMを研究と執筆に使う方法

  • ClaudeなどのLLMを毎日使う一方で、出力は必ず 検証・編集・書き直し する
    • 文献レビューの下書きにClaudeを使った後、元論文と投稿を自分で読む
    • ブログが引用した元研究を探して置き換え、資料を再構成し、不要な詳細を削る
  • 論文提出前には原稿全体を徹底的に読み、参考文献を手動で確認する
    • Claudeに曖昧な部分を見つけさせた後、選択式質問でインタビューさせて意図を合わせる
    • bib-audit 実行後も、Google Scholar、IEEE、CVFなどのデータベースで個別項目を確認する
    • 何年もかけて蓄積したZoteroの実際のBibTeXも再利用する
  • 早い段階で他者からフィードバックを受け、必要なら下書き中でも文章全体を再構成する
    • 締切直前の慌ただしい作業が、低品質なLLM論文を生む原因だと見ている
    • LLM以前から形成してきた 研究感覚 が重要であり、若手研究者が方向性なしに研究を生成する環境を懸念している
  • Claudeの文体を制御する方法

    • エージェントが書いた文は過度に密度が高く流れが悪いため、em dashとセミコロンを制限する
    • Fable 5はem dashの代わりにコロンを濫用し、B2B SaaSマーケティング調の文体を作る傾向がある
    • 過度に攻撃的でも平板でもなく、分野外の読者にも読める文を目指す
    • 科学ライティングと ASD-STE100 Simplified Technical English の間にあるルールを含むスキルが効果的だった
    • 文章の目的と読者を先に定め、読者に合わせて形式を調整する必要がある
    • Claudeのデフォルト文体は科学読者に適していない
    • 過度な太字、箇条書き、マーケティング文句が残ると、内容の出典や検証有無まで疑われる可能性がある

公開告知より投稿段階のフィルタリングが必要な理由

  • LLM使用の公開義務は善意の研究者には有用かもしれないが、実際の行動を大きく変えることはできないと見ている
    • TorchGeoには「LLM未使用」「LLM補助」「LLMが全体を執筆」の段階別AIポリシーを追加したが、最後の項目を自発的に選ぶ可能性は低い
    • LLMで書いたとしても、結果が検証され再現可能な良い論文なら受け入れられる
  • よくあるLLMエラーを見つけ、原稿が査読可能な状態かを判別する デスクリジェクト装置 またはフラグ付けツールが必要である
    • 現在は査読者が事実上デスクリジェクト作業を分担しており、善意の査読者に公平ではない
    • ICLRは2027年から OpenReviewで著者名を公開 する
  • 責任は著者・指導者・エリアチェア・主催者・学会すべてにある
    • 著者は履歴書を埋めるために低労力の論文を大量投稿すべきではない
    • 指導者とメンターは、学生の低労力投稿を防ぐべきである
    • 主催者は大規模投稿の中からそれを選別する方法を用意すべきである
  • 出版インセンティブの問題はLLM以前から存在しており、LiptonとSteinhardt は2018年に数学的な見せかけ、言葉の誤用、ずれたインセンティブを整理した
  • LLMで授業プロジェクトや自動研究結果をNeurIPS形式の論文のように作れても、実際の研究貢献でなければ提出すべきではない
    • Opus 4.6とKarpathyのautoresearchリポジトリを使って、LandCoverAIでSOTAに見える結果と論文を作ることはできたが、研究貢献ではないため提出しなかった
    • AAAI 2027にはアブストラクト 4万8,000件 が提出され、自動フィルタリング問題の規模はさらに大きくなる

bib-auditで参考文献を自動監査

  • bib-audit はMITライセンスのClaude Codeスキルで、参考文献のタイトル・年・全著者リストを登録機関の記録と照合する
  • .bib.bbl、PDFを入力できる
    • .bblとPDFでは、Claudeがレンダリングされた参考文献を構造化フィールドに復元する
    • その後スクリプトが CrossrefarXivDataCiteSemantic Scholar で各項目を確認する
  • 結果は重大なエラーから順に並ぶ
    • 存在しない論文
    • 捏造された識別子と偽の著者
    • 実在論文の誤ったメタデータ、切り詰められた著者リスト、プレプリントと出版版の年の差
    • ページ範囲の単一ハイフン、URLとして保存されたDOI、J.D.形式のイニシャルのような書式エラー
  • タイトルの存在有無だけを検査するのではなく 全著者リスト を比較するため、SatMAE事例のような著者差し替えを見つけられる
  • DOIやarXiv IDなしにタイトル検索だけで関連付けられた項目は断定せず、手動確認が必要な推奨事項として返す
    • レビューでは動機を推測せず、「arXiv記録の筆頭著者はYuyang CongではなくYezhen Cong」のように観察された事実だけを報告すべきである
  • .bib検査は読み取り専用で別途依存関係がなく、識別子で固定された項目の不一致だけで失敗するよう設定できるため、提出前の CIゲート として使える
  • Claude以外にも npx skills add isaaccorley/skills を通じて、Codex、Copilot、Cursorや他のエージェントにインストールできる

査読者が確認すべき機密性と学会ポリシー

  • 監査プロセスは非公開投稿論文の参考文献の一部を ホスト型LLM に送信するため、レビュー作成にLLMを使っていなくても学会ポリシーに違反する可能性がある
  • ECCV 2026ポリシー は、ローカルまたはAPI LLMでレビューやメタレビューを作成することを禁じ、投稿論文の相当部分をLLMと共有する行為も別途禁止している
  • WACV査読者ガイドライン は、LLM生成レビューを非常に無責任な行為と位置づけている
    • 違反時には査読者本人の論文がデスクリジェクトされる可能性がある
    • 機密資料を査読者ではない対象に見せることも禁じており、ホスト型LLMは査読者ではない
  • NeurIPS LLMポリシー は、査読者がLLMサービスと共有できる内容を制限している
  • 著者は提出前に自分で bib-audit を実行できるが、査読者は使用前に必ず当該学会の LLM・機密性ポリシー を確認しなければならない

1件のコメント

 
GN⁺ 1 시간 전
Hacker News のコメント
  • 現在の AI研究の出版プロセスでは、論文の執筆、査読、読解・要約までAIが担っている
    NeurIPSも AI支援査読の実験を進めており、主要学会の論文が多すぎて人間がすべて読むのは不可能
    学術出版のプロセスでは、人間が非常に速いペースで自動化に押し出されつつある

    • 人間を出版プロセスから排除しているというより、低品質論文の大量生産を自動化しているのだと思う
      最近のEMNLP査読でも似たようなことを経験したが、AIはまだ研究の品質を判断できる水準にはほど遠い
      誠実なピアレビューという公共財が乱用されているが、極端な社会的スコア制で査読システムへのアクセスを制限する以外に、明確な解決策はなさそうに見える
    • 次の段階は、AIが運営するジャーナルが別のAIから購読料を取り、AIが運営する大学が論文と引用が最も多いAIを昇進させる、ということになりそう
    • AI利用が検出された論文もなお採択された、という点が重要
      研究者の大多数がAIを積極的に活用しているため、それを罰したり、自分たちまで不利になる環境を作ったりしたくないのだろう。雰囲気はおおむね 心配せず受け入れろ という方向
      結局、最初から科学そのものを真剣に重視していた人はほとんどいなかったという、厳しい現実が露呈している
    • フードデザートに似た 推論デザート(reasoning deserts) を考えさせられる
      経済的な計算のために、人間の健康と繁栄に必要な実際の構成要素を欠いた、見た目だけ似た代替物が供給される空間を指す
    • 人間を自動化で追い出しているのではなく、学界そのものを無意味なものにしている
      これが学界の一般的な姿なら、研究費削減を主張する側にも共感してしまう
  • これは 出版しなければ淘汰される体制 の論理的帰結
    この体制をなくせば問題も大半は消えるはずで、管理者が単純な指標を望んだとしても、研究にはそのような指標はない

    • 科学の出版実績は、ソフトウェア開発で書いたコードの行数を測るようなもの
      技術的負債まで同じで、論文は数え切れないほどあるが、その大半は再現されない可能性が高く、どの論文がそうなのかは分からない
    • では、複雑でも使える研究評価指標があるのか疑問
      出版・引用実績は操作され得るが具体的で、引用の多い論文は概して有用なので著者に報酬が回る
      これをなくしてより良い代替案を用意できなければ、今よりもさらに人脈と話術に左右される可能性がある
    • 教授はすでに論文以外にも、講義、奉仕活動、委員会運営、大学院生の指導・修了といった複数の要件を満たす必要があり、いずれもテニュア審査に反映される
  • AIが作った誤りをそのまま提出する行為は、盗用に準じる違反として扱い、同様の処分を下すべきだと思う

    • AI利用を正直に開示しなければ、ジャーナル投稿を1年以上禁止する方針がすでに導入されつつあると理解しており、arXivも似た方向のようだ
      開示の有無と過度な利用は別問題だが、幻覚や誤りすら確認していないのなら、AIよりも無能さと怠慢が本質的な問題だ
  • arXivの月別投稿統計対数スケールにしたほうがよさそう
    2027年の学界はMoltbookのように変わるかもしれない

    • 対数的な増加傾向がLLM論文の時代以前から始まっていたのなら、単に arXivでのプレプリント公開の人気上昇 を反映しているだけだと素朴に期待することもできる
    • 方向性自体は合っているが、分野やサブ分野ごとに状況は大きく異なる
      低品質論文は派手で大きなテーマに集中し、とくに機械学習分野が深刻だが、重要でありながらニッチで、まだこうした著者たちが手を出していないテーマも多い
      そうした分野は今も真剣な研究者が主導しているが、自分で勉強しなければ存在を知るのは難しい
  • これは学界が論文とジャーナルのオープンアクセスを真剣に扱ってこなかった副作用
    論文がジャーナルのアクセス制限に阻まれていなければ、引用された論文や引用文の存在有無くらいは簡単に検証できる

    • 問題は学界よりも、出版社がブランドに頼ってできるだけ収益を搾り取ろうとしていること
      ピアレビューは、報酬なしに名声だけを得て、プラットフォームと出版社が利益を持っていくRedditモデレーターの役割に似ている
      著者が出版費を払い、別の著者が無料で校正までしてくれる構造であり、研究者がプレプリントや人気論文を個人サイトに載せるのは自然な選択
    • 論文の存在有無は、多くの場合、ジャーナルの公開インデックス、著者・抄録情報、DOI引用だけで、クローズドなジャーナルでも簡単に確認できる
      ただし引用内容が実際の主張と一致しているかを検証するには、論文を読んで解釈する必要があるため、オープンアクセスだけで簡単になるわけではなく、AIで一次確認しても非常に骨の折れる作業だ
    • これはどの集団でも繰り返される、人間の慢性的な失敗を示している。誰も自分の家を掃除しようとしない
    • 引用された論文の存在有無はすでに簡単に確認できる
    • 少なくとも生物医学研究では、多くが出版直後、または1年後にオープンアクセスへ移行する
  • 学会に論文を投稿すると、4〜5本を義務的に査読しなければならないというのは本当なのか疑問
    きちんとした論文であっても、出自や専門性の分からない人たちに強制的に査読されることになる

    • 本当で、4〜5本というのも少なめに見積もった数字
      私は7本を強制的に査読し、3万本の中から希望する論文30本に応募したが1本も割り当てられず、十分な専門性のない論文7本を担当した
    • ACL系の学会では完全にランダムな人というわけではなく、主要ACLイベントまたはFindingsに2本以上の論文を出し、さらにACL Anthologyまたは主要なML・AI学会に追加で1本以上の論文を出した著者である必要がある
      しかし投稿論文は増え続け、ボランティア査読者は不足しているため、義務査読が実際に実施されている: 査読インセンティブ基準
  • Chavdaのパラドックスが参考になる: https://zencapital.substack.com/p/chavdas-paradox

  • 最初はCalebとIsaacが、出版論文でAI利用を検出する2つのアルゴリズム名だと思ったが、実際にはAIの助けを借りて文章を書いた2人の著者名だった
    2人が異なる判定を下したのなら、それぞれが問題ありとした論文がどれほど重なっていたのか気になる

  • まだアルファ段階だが、数週間後のShow HN公開を目標に、引用検証アプリケーション https://veruscite-data.com/を開発中
    生成AIツールに慣れている人は、記事でCalebとIsaacが提供した機能を直接使ってもよいが、このツールはトークン効率がより高く、抽出した参考文献を確認・修正しやすいGUIを提供する