Cloudflare、9月15日からAI訓練クローラーを広告ページで遮断へ
Cloudflareが、AIクローラーの用途別分離をAI企業に要求した。期限は9月15日。従わなければ遮断する。
「検索用」と「訓練用」を分けろ
Cloudflareが現地時間7月1日、AIクローラーに対する新たな方針を発表した。
AI企業に対し、ウェブクローラーを検索用、AIエージェント用、モデル訓練用の3種類に分離するよう求め、9月15日を期限に設定している。
| 分類 | 広告ページ | 非広告ページ |
|---|---|---|
| 検索 | 許可 | 許可 |
| AIエージェント | ブロック | サイト設定に依存 |
| モデル訓練 | ブロック | サイト設定に依存 |
| 混合 (検索+訓練) | ブロック | サイト設定に依存 |
期限までに分離しない「混合クローラー」は、広告が掲載されているページでデフォルトのブロック対象になる。Cloudflareはこう説明している。広告を掲載しているページは、サイト運営者が人の閲覧を前提にしている。その前提に反するボットは遮断する。新規顧客、既存顧客の新規サイト、そして既存の無料プラン利用者すべてに適用される。
対象はAI訓練クローラーだけではない。AIエージェント(ChatGPTやGeminiがユーザーの代わりにウェブを閲覧する機能)も、広告ページではデフォルトでブロックされる。検索クローラーだけは従来通り許可される。
Googleが名指しされた
Cloudflareが公式ブログで最も強く批判したのはGoogleだ。
世界最大の検索エンジンは、他のAI企業の約2倍の情報にアクセスできている。それは、検索エコシステムへの参加とAIエコシステムへの参加を切り離すことを困難にしているからだ(Cloudflare公式ブログ)
Googlebotは検索インデックスの構築とAI機能(AI OverviewやAIモード)を1つのクローラーで処理している。サイト運営者がGoogle検索に表示されたければ、Googlebotを許可するしかない。許可すれば、同じクローラーがAI訓練にもコンテンツを使う。拒否するか、受け入れるか。二択だ。
GoogleはAI訓練のオプトアウト手段としてGoogle-Extendedというrobots.txtトークンを提供している。これを設定すればGeminiやVertex AIへのコンテンツ利用を拒否でき、Google検索の表示には影響しない。だがGoogle-Extendedはあくまでrobots.txt上の「使用許可」を制御するトークンであり、Googlebot自体は分離されない。サイト運営者のアクセスログには、検索目的のリクエストもAI訓練目的のリクエストも同一のユーザーエージェントとして記録される。Cloudflareが問題視しているのは、この不透明さだ。
9月15日以降、Cloudflare上でAI訓練のブロックを選択したサイトでは、Googlebotのように検索と訓練を兼ねるクローラーがデフォルトでブロック対象になる。Applebot、BingBotも同様の扱いを受ける。サイト運営者が明示的に許可設定を変更すれば例外にできるが、何もしなければ遮断が適用される。
Cloudflareは全ウェブサイトの20%以上にインフラを提供している。その規模でデフォルト設定が変わることの影響は小さくない。
Pay Per CrawlからPay Per Useへ
Cloudflareは昨年7月1日に「Content Independence Day(コンテンツ独立記念日)」を宣言し、AIクローラーのデフォルトブロックとPay Per Crawl(クロール課金)を導入した。あれから1年、Cloudflareは自ら「クロール単位の課金は不十分だった」と認めている。
理由は明快で、1回クロールされた記事がAI生成の回答に何千回引用されることもあれば、何度クロールされても一度も引用されないこともある。クロール回数は、コンテンツが生み出す価値の指標にならない。
新モデルPay Per Useでは、コンテンツがAIの回答に実際に使われた時点で報酬が発生する。初期パートナーにはCeramic.aiとYou.comが名を連ねた。Ceramic.aiではAI検索結果にコンテンツが表示されるたびにサイト運営者へ対価が支払われ、You.comではAIエージェントがプレミアムコンテンツにオンデマンドでアクセスした際に課金が発生する。
ボットが人を超えた先に
Cloudflareのマシュー・プリンス(Matthew Prince)CEOは今回の発表で、ボットがインターネットトラフィック全体で人のアクセスを上回ったと述べた。同社が3月のSXSWで「2027年にボットが人を超える」と予測していたのは既報だが、現実はその予測を前倒しした。
2026年6月時点の同社データでは、HTMLコンテンツへのリクエストのうちAIクローラーが50.6%、検索用ボットは10.7%。クローラーの目的別ではモデル訓練が52%を占め、2025年春の22%から急増した。検索と訓練を兼ねる混合クローラーは全体の36%超に達している。
Cloudflareのデータでは、AIクローラーのトラフィックの50%以上が変更のないページを再取得する無駄なリクエストだ。サイト運営者の帯域と計算資源を消費し、AI企業にとっても新しい情報を得られない。この無駄を減らすため、Cloudflareはページの更新状況をクローラーに伝える「鮮度シグナル」の研究プログラムも開始した。
Cloudflareの動きには、自社のボット管理サービスやPay Per Use基盤の利用拡大というビジネス上の意図が見える。インフラ企業が課金層とルール制定層を兼ねることへの懸念も残る。だがAI企業がコンテンツを大量にクロールしてほぼ何も返さない現状を放置する方が、ウェブの持続性にとってはるかに大きいリスクだ。Cloudflareの2025年データでは、Anthropicのクロール対リファラル比率は3万8,000対1、OpenAIは1,091対1。
| 企業 | 比率 | クロール回数 |
|---|---|---|
| 14 : 1 | 14回に1回流入を返す | |
| OpenAI | 1,091 : 1 | 1,091回に1回 |
| Anthropic | 3万8,000 : 1 | 3万8,000回に1回 |
「検索とAI訓練を同じクローラーで処理する慣行はもう終わりにすべきだ」という要求自体は、サイト運営者の立場からは筋が通っている。
参照元:Your site, your rules: new AI traffic options for all customers