arXiv、低品質なAI生成投稿の違反者に1年間の投稿停止措置
プレプリントサーバーのarXivが、AI生成物を混入させた著者を1年間追放する方針を発表した。1ストライク制で、復帰後の投稿には査読通過が必須となる。CS分野の先行投稿文化が折れる。
1ストライクで1年、復帰には査読通過が必須
arXivがAI生成物の混入に対して罰則を強化している。2026年5月14日深夜、計算機科学者のトーマス・ディートリッヒ(Thomas Dietterich)がarXiv計算機科学セクションの議長として方針を公表した。ディートリッヒは長年機械学習分野を牽引してきた人物で、オレゴン州立大学の名誉教授だ。
「生成AIツールが不適切な言語、剽窃、偏った内容、誤り、誤った参考文献、誤解を招く内容を生成し、その出力が科学的著作に含まれた場合、その責任は著者にある」とディートリッヒは投稿した。「ペナルティを最近明確化した」と続け、罰則の具体的な中身を示す。
罰則の中身は重い。1年間のarXiv投稿禁止、復帰後も「すべての投稿は事前に評判の高い査読付き会場で受理されていること」が条件となる。プレプリントを先に公開し、コミュニティのフィードバックを受けながら査読に回す、というCS分野の標準ワークフローを破壊する措置だ。
著者が一度でも論文にAIスロップを混入させて発覚した場合、追放対象となる。ただし決定には異議申し立てが可能とディートリッヒは説明している。
「我々が適用するのは反論の余地のない証拠がある場合のみだ」とディートリッヒは説明する。内部プロセスとして、モデレーターが問題を文書化し、セクション議長が確認してから罰則が課される段取りになっている。
「反論の余地のない証拠」が何を指すか
ディートリッヒが具体例として挙げたのは、いかにも生成AIが残しがちな痕跡だ。
幻覚による参考文献、LLMからのメタコメント(「ここに200語の要約があります、変更しますか?」「この表のデータは例示的なものです、実験の実数値を入れてください」など)
要するに、著者が出力を読み返していないことを示す痕跡が決め手となる。AI支援そのものは禁止されていない。AIに書かせたものを著者が確認せず、そのまま投稿に至る行為こそが罰の対象。
ここで分岐点が生まれる。タイポ1つと、参考文献の60%が捏造された論文を、同じ「反論の余地のない証拠」と扱えるのか。前者は付録の見落としに近く、後者は論文の信用そのものが崩壊している。モデレーターが両者を区別できるのか、その線引きが今後の運用を左右する。
Hacker NewsのコメントスレッドでもarXivの公式ポリシーページにディートリッヒの投稿に対応する記述がまだ存在しないという指摘が複数出ている。Xスレッドでの宣言が先行し、規定の文書化が追いついていない状態だ。
CS分野のワークフローが壊れる
CS研究者にとって、この罰則は単なる注意喚起ではない。arXivから1年間締め出される時点ですでに厳しいが、復帰後に「査読を先に通せ」と求められると、再投稿のハードルがさらに上がる。
通常、CSの論文は会議への投稿と同じ週にarXivに上がる。同じアイデアを別チームに先取りされる前にタイムスタンプを確保するためだ。査読を待つ期間は数ヶ月から1年になる場合もある。その間にライバルが先に発表してしまえば、後発組は「先行発表」のクレジットを失う。
一度AIスロップで足を踏み外せば、プレプリント先行のCS文化からそのまま締め出される。罰の重さは「投稿停止1年」よりも、その先の長期的なハンディキャップにある。
なぜ今なのか
arXivはこの1年でAI生成物に対して段階的に締め付けを強めてきた。2025年10月末には計算機科学カテゴリでレビュー論文とポジションペーパーの取り扱いを変更し、これらは事前にジャーナルや会議で受理されている必要があるとした。理由として「LLMによってこの種の論文が容易に大量生産されるようになった」と明記している。
2026年1月には、初回投稿者にエンドースメント(既存著者からの推薦)を求める制度も導入した。詐欺的投稿の増加への対応として打ち出された措置。
そして今回、内容種別を問わずAIスロップが混入したすべての論文に対して、著者個人への直接的な罰則を導入した形になる。段階的な締め付けが、最も重い段階まで到達した。
|
2025年
10月31日
第1段
CSカテゴリでレビュー論文・
ポジションペーパーを制限 事前にジャーナルや会議で
受理されていることを必須化。 「LLMで論文が大量生産される」と明記。 2026年
1月21日
第2段
初回投稿者にエンドースメント
を必須化 既存著者からの推薦を求める制度。
詐欺的投稿の増加への対応として導入。 2026年
5月14日
第3段
著者個人への1ストライク制
1年間追放 復帰後の投稿は査読通過済みに限る。
CS分野のプレプリント先行投稿という 標準ワークフローを断ち切る重さ。 |
医療論文では捏造引用が3年で12倍
arXivが動いた背景には、AI生成参考文献の汚染が無視できない速度で広がっている事実がある。
5月7日にThe Lancetに掲載されたコロンビア大学の研究によると、PubMed Centralの250万本の生物医学論文を監査したところ、捏造された参考文献の出現率は2023年の論文2828本に1本から、2026年初頭には277本に1本まで増えていた。3年で12倍以上の伸びだ。
|
2023年
2828本に1本
×1.0
2025年
458本に1本
×6.2
2026年初頭
277本に1本
×10.2
|
偽の参考文献が文献に紛れ込むと、それは臨床ガイドラインに反映され、医師が患者の治療方針を決める根拠になる。
研究主導者のマキシム・トパズ(Maxim Topaz)は声明でこう警告している。AIが書いた論文を著者が確認せず、出版社のレビュアーも見抜けず、そのまま医療現場の意思決定基盤に流れ込む。arXivは生物医学プレプリントのbioRxivとは別組織だが、同じ性質の汚染が物理学やCS分野で起きていることは、ディートリッヒ自身の例示が示している。
7月の独立とコーネルからの分離
arXivは現在コーネルテックが運営しているが、今年7月に独立した非営利法人へ移行する予定だ。コーネルテック学長兼副プロボストのグレッグ・モリセット(Greg Morrisett)はインタビューで、独立化はより広範な寄付者からの資金調達を可能にするためであり、その資金は「AIスロップへの対応」のために必要だと述べている。
組織変更とポリシー強化が同時に進む。プレプリントサーバーが30年以上守ってきた「自由で速い公開」の原則を、AIスロップとどう両立させるか。独立後のarXivが、まずここで真価を問われる。
タイポか、捏造文献60%か。その境界線をどう引くかが、すべてを決める。
参照元
- The Lancet - Fabricated citations: an audit across 2·5 million biomedical papers
- arXiv blog - Attention Authors: Updated Practice for Review Articles and Position Papers in arXiv CS Category