本文へ移動
リライトレーダーRewrite Radar
メニュー

公開

AIクローラーはrobots.txtで拒否できる?止めても検索に影響しないものと、止めると困るもの

AIのクローラーは、各社の名前(GPTBot・ClaudeBot・Google-Extendedなど)をrobots.txtに書けば止められます。Google-Extendedは検索の掲載や順位に影響しないと公式にありますが、Googlebotまで止めると検索のクロールも止まります。止めたあとの確認手順まで。

この記事のまとめ

AIのクローラーは、robots.txtに各社が公開している名前を書けば、名前ごとに止められます。学習用の名前は、OpenAIがGPTBot、AnthropicがClaudeBot、GoogleがGoogle-Extendedです。Googleの公式ドキュメントは、Google-ExtendedがGoogle検索での登録やランキングに影響しないと書いています。ただし、AIによる概要はGoogle検索の一部で、そこへのアクセスを管理するのはGooglebotのrobots.txtです。Google-ExtendedではAIによる概要は止まりません(AIによる概要から外す設定は、Search Consoleの「検索の生成 AI」にあります)。いちばん避けたいのは「User-agent: *」に「Disallow: /」を書くことで、Googlebotまで止まり、Google検索のためのクロールができなくなります。各社の検索用のボットについては、OpenAIはOAI-SearchBotを止めるとChatGPTの検索の回答に出なくなる、AnthropicはClaude-SearchBotを止めると表示が下がる可能性があると書き、PerplexityはPerplexityの検索結果に出すにはPerplexityBotの許可を勧めています。利用者の操作で取りに来るボットには、robots.txtが効かない場合があります。止めたあとは、Search Consoleのrobots.txtレポートとURL検査で、Googlebotまで止めていないかを確かめます。

AIのクローラーは、robots.txtで1社ずつ、名前を指定して止められます。ただし、止め方を間違えると、Google検索のためのクロールまで止まります。

自分の記事をAIに読まれたくない、学習に使われたくないと思っているけれど、robots.txtをほとんど触ったことがなく、書き間違えて検索から消えるのが怖い。そんな個人ブログの方に向けて書いています。

読み終えたときには、どの名前を書けば何が止まり、何は止まらないのか、止めても困らないものと止めると困るものがどれか、そして止めたあとにSearch Consoleで何を見ればよいかが分かるはずです。各社の説明は、2026年10月9日に公式ページの原文で確かめました。

次に直す記事を自分のデータで調べる

Search ConsoleのZIPを読み込むと、候補の判定と1記事分の診断カードを無料で確認できます。登録は不要です。ZIPが無い場合は、診断カードの見本を確認できます。

AIのクローラーは1種類ではなく、目的ごとに名前が分かれている

「AIクローラー」とひとまとめに呼ばれますが、各社は学習に使うもの、自社の検索に使うもの、利用者の操作で取りに来るものを別の名前で出しています。robots.txtは名前ごとにしか止められないので、まず名前と用途の対応を見ます。OpenAIは自社の説明ページで "Each setting is independent of the others" と書いていて、学習用だけ止めて検索用は残す、といった選び方ができます。

会社robots.txtに書く名前何に使うと書かれているか止めたときの記述
GoogleGoogle-ExtendedGeminiのモデルの学習と、GeminiアプリなどでのグラウンディングGoogle検索での登録やランキングに影響しない
GoogleGooglebotGoogle検索(すべての検索機能を含む)、画像検索、ニュース、Discoverなどこれらのクロールが止まる(止めてはいけない側)
OpenAIGPTBot生成AIの基盤モデルの学習学習に使うべきでないことを示す
OpenAIOAI-SearchBotChatGPTの検索機能ChatGPTの検索の回答に出なくなる(ナビゲーション用のリンクには出ることがある)
OpenAIChatGPT-UserChatGPTで利用者が操作したときrobots.txtのルールが当てはまらない場合がある
AnthropicClaudeBot生成AIモデルの学習に役立つ可能性のある内容の収集将来の内容を学習データから除外すべきことを示す
AnthropicClaude-SearchBot検索結果の品質の向上利用者の検索結果での表示と精度が下がる可能性がある
AnthropicClaude-UserClaudeの利用者が質問したとき利用者が指示した検索での表示が減る可能性がある
PerplexityPerplexityBotPerplexityの検索結果にサイトを出してリンクする(AIの基盤モデルのためには使わないと明記)Perplexityの検索結果に出すには許可を勧めている
PerplexityPerplexity-UserPerplexityで利用者が質問したとき利用者の依頼による取得なので、robots.txtのルールを通常は無視する

出典は、Googleの「Google の一般的なクローラーの一覧」、OpenAIの「Overview of OpenAI Crawlers」、Anthropic(Claudeヘルプセンター)の「Does Anthropic crawl data from the web, and how can site owners block the crawler?」、Perplexityの「Perplexity Crawlers」です。名前は原文の表記のまま載せました。ここに無い会社のクローラーは、私は原文を確かめていません。止めたい会社があれば、その会社の公式ページで名前を確かめてください。

表の右端は、各社の書き方に合わせています。学習用のGPTBotとClaudeBotについて、OpenAIは "Disallowing GPTBot indicates a site’s content should not be used in training generative AI foundation models."、Anthropicは「サイトがClaudeBotへのアクセスを制限すると、そのサイトの将来のコンテンツをAIモデルトレーニングデータセットから除外すべきであることを示します。」と書いています。どちらも「示す」という言い方で、Anthropicは対象を「将来のコンテンツ」としています。すでに集められた内容がどうなるかは、どちらのページにも書かれていません。

robots.txtには、止めたい名前ごとにグループを足す

robots.txtの置き場所や基本の形はサイトマップは必要か・robots.txtの書き方、個人ブログは無くても困りにくいに書いたので、ここではAIのクローラーを止める部分だけを書きます。学習用の3つを止めるなら、今あるrobots.txtの末尾に次のように足します。

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

「User-agent:」の行で相手を指定し、その下の「Disallow: /」でサイト全体のクロールを断ります。Anthropicのページにも、ClaudeBotをサイト全体から止める例として同じ2行が載っています。Googleの「Google による robots.txt の指定の解釈」によると、同じルールを複数の相手にかけたいときは「複数のユーザー エージェントに適用するルールは、各クローラーの user-agent 行を繰り返すことでグループ化できます。」とあり、User-agentの行を3行並べて最後にDisallowを1行書く形もGoogleの解釈では使えます。ほかの会社がどう読むかは各社のページに書かれていないので、迷ったら上のように名前ごとに分けて書くのが確実です。

書くときに気をつけたいのは3つです。

  • 今ある「User-agent: *」のグループは消さない。AI向けのグループは、それとは別に足します。Googleの解釈では「特定のユーザー エージェントのグループとグローバル グループ(*)は結合されません。」とされていて、名前で指定したグループと「*」のグループは別々に扱われます
  • 名前は原文の表記どおりに書く。Googleの解釈では「user-agent フィールドの名前とその値では、どちらも大文字と小文字が区別されません。」ですが、これはGoogleのクローラーの話です。ほかの会社のクローラーがどう読むかは各社のページに書かれていないので、表記を合わせておくのが確実です
  • サブドメインごとに置く。Googleの書き方ガイドには「robots.txt ファイルは、投稿したプロトコル、ホスト、ポート内のパスにのみ適用されます。」とあり、Anthropicも「オプトアウトしたいすべてのサブドメインについてこれを実行してください。」と書いています。ブログをサブドメインで運営しているなら、そのサブドメインのrobots.txtに書きます

使っているブログサービスによっては、robots.txtを自分で書き換えられないことがあります。Googleの「robots.txt の概要」も「Wix や Blogger などの CMS をご利用の場合は、robots.txt ファイルを直接編集する必要がない、または編集できない可能性があります。」と書いています。その場合は、使っているサービスのヘルプでrobots.txtやクローラーの設定を探してください。

止めても検索に影響しないもの、止めると困るもの

Google-Extendedは、Google検索の掲載と順位に影響しない

Googleのクローラーの一覧は、Google-Extendedについて次のように書いています。

Google-Extended が Google 検索でのサイトの登録に影響したり、Google 検索でのランキング シグナルとして使用されたりすることはありません。
— Google「Google の一般的なクローラーの一覧」(日本語版の最終更新2026年9月16日)

英語版(最終更新2026年7月14日)も "Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search." で、同じ内容です。Google-Extendedは「スタンドアロンのプロダクト トークン」で、独自のクローラーが来るわけではなく、Googleが取得した内容をGeminiのモデルの学習やグラウンディング(回答の事実確認のために検索インデックスの内容をモデルに渡すこと)に使ってよいかを伝えるための名前です。

ただし、Google-ExtendedではAIによる概要は止まらない

ここが誤解しやすいところです。Googleの「AI 機能とウェブサイト」は、AIによる概要やAIモードについてこう書いています。

AI は検索に組み込まれており、検索が機能するうえで欠かせないものです。そのため、サイト所有者は Googlebot の robots.txt ディレクティブを使って、検索用にクロールされるサイトへのアクセスを管理します。
— Google 検索セントラル「AI 機能とウェブサイト」(日本語版の最終更新2025年12月31日)

同じページは、Google-Extendedを「Google の他のシステムで AI トレーニングとグラウンディングを制限するには」という別の項目で案内しています。つまり、AIによる概要に出るかどうかはGoogle検索の側で決まり、Google-Extendedでは止まりません。検索に表示される内容を絞りたいときにGoogleが挙げているのは、nosnippet・data-nosnippet・max-snippet・noindexです。

AIによる概要から外れたいなら、別の道具があります。Search Consoleの「検索の生成 AI 設定」で、対象はAIによる概要・AIモード・Discoverの生成AI機能です。同じヘルプは、学習との関係を次のように分けています(日本語版はAI翻訳と注記されているので、英語版と照合しました)。

この設定は AI のトレーニングには影響しません。検索の生成 AI 機能で回答を生成するために使用されるモデルのトレーニングを制限するには、Google-Extended をご利用ください。
— Search Console ヘルプ「検索の生成 AI 設定」

表示から外すのはSearch Consoleの設定、学習を制限するのはrobots.txtのGoogle-Extendedと、Googleの中でも道具が分かれています。設定の中身と、除外したときに失うものは、AI Overview対策で個人ブログができる3つと、できないことに書きました。

「User-agent: *」で全部止めると、Googlebotも止まる

いちばん避けたい書き方は、AIを止めるつもりで次のように書くことです。

User-agent: *
Disallow: /

Googleの「robots.txt の書き方、設定と送信」には「アスタリスク(*)は、各種の AdsBot クローラーを除く、すべてのクローラーに一致します。」とあり、この2行は、AdsBot以外のすべてのクローラーをブロックする例として載っています。Googlebotも含まれます。Googlebotに対する設定は「Google 検索(Discover やすべての Google 検索機能を含む)だけでなく、Google 画像検索、Google Video、Google ニュース、Discover などの他のサービスにも影響します。」と書かれています。

「Googlebot」の名前で止めるのも同じです。Googleの検索用のクローラーを止めると、検索とAIによる概要の両方に出るためのクロールが止まります。AIを止めたいだけなら、Googleについて書く名前はGoogle-Extendedだけです。

各社の検索用のボットは、止めるとその会社の検索で出にくくなる

OpenAIのOAI-SearchBot、AnthropicのClaude-SearchBot、PerplexityのPerplexityBotは、学習用ではなく、それぞれのAIの検索機能のためのボットです。OpenAIは "Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers, though can still appear as navigational links." と書き、Anthropicも止めると「ユーザー検索結果での表示と精度が低下する可能性があります。」としています。PerplexityもPerplexityBotについて、検索結果に出すには許可するよう勧めています。

つまり、学習には使われたくないが、AIの検索から読者が来るのは歓迎なら、学習用(GPTBot・ClaudeBot・Google-Extended)だけを止めて、検索用は残す、という選び方になります。どちらも止めたいなら、検索用の名前も足します。決めるのは自分ですが、止めた分だけ、その会社の検索から来る読者が減る可能性がある、という各社の説明は知っておいてください。

robots.txtで止められないこと

robots.txtは、相手が守ってくれることを前提にした仕組みです。Googleの「robots.txt の概要」は、はっきりこう書いています。

サイトに対するクローラーの動作に対して、robots.txt ファイルの指示を強制適用することはできません。指示に従うかどうかはクローラー次第です。
— Google 検索セントラル「robots.txt の概要」(日本語版の最終更新2025年12月18日)

そのうえで、各社の文書から読み取れる「止まらないもの」は次のとおりです。

  • 利用者の操作で取りに来るボット。OpenAIはChatGPT-Userについて "Because these actions are initiated by a user, robots.txt rules may not apply."、PerplexityはPerplexity-Userについて "Since a user requested the fetch, this fetcher generally ignores robots.txt rules." と書いています。一方、AnthropicはClaude-Userを、利用者の依頼で取りに来るアクセスをサイト所有者が制御できるものとして説明しています
  • すでに集められた内容。Anthropicが学習データから除外の対象にしているのは「将来のコンテンツ」です。過去の分がどうなるかは、私が確かめた4社のページには書かれていません
  • 名前を偽ったアクセス。Googleのクローラーの一覧にも「注意: HTTP ユーザー エージェント文字列はなりすましが可能です。」とあります。robots.txtは名前で相手を選ぶ仕組みなので、名乗りを偽られると区別できません

なお、AI向けのファイルとして話題のllms.txtは、AIに読んでもらうための案内図として提案されたもので、止めるための設定ではありません。詳しくはllms.txtは必要?Google検索では使われない、置くかの判断に書きました。サーバーの設定でIPアドレスごと拒否する方法もありますが、AnthropicはIPアドレスのブロックなどの方法について「正しく機能しない可能性があり、オプトアウトを永続的に保証しない可能性があります。」と書き、robots.txtでの設定を案内しています。

直す記事と作業内容を決める

Search ConsoleのZIPを読み込むと、候補の判定と1記事分の診断カードを無料で確認できます。登録は不要です。ZIPが無い場合は、診断カードの見本を確認できます。

止めたあと、Search ConsoleでGooglebotまで止めていないか確かめる

robots.txtを書き換えたら、Googlebotを巻き込んでいないかを4つの順で確かめます。書き間違えても、気づかないまま検索の表示だけがじわじわ減っていくことがあるので、書き換えた当日に確認しておくのが安全です。

手順1:ブラウザでrobots.txtを開く

Googleの書き方ガイドは、シークレットウィンドウなどで https://(自分のドメイン)/robots.txt を開き、内容が表示されるかを見るよう案内しています。書いたはずのAI向けのグループが表示されるか、「User-agent: *」の下に「Disallow: /」が紛れ込んでいないかを、目で確かめます。

手順2:robots.txtレポートで「取得済み」と問題の数を見る

Search Consoleのrobots.txtレポートを開きます(ヘルプのページから開けます)。ヘルプによると「robots.txt レポートには、サイトの上位 20 個のホストに対して Google が検出した robots.txt ファイル、前回のクロール日、発生した警告やエラーが表示されます。」(日本語版はAI翻訳と注記されているので、英語版と照合しました)。見るのは次の3つです。

  • 取得ステータスが「取得済み」か。「未取得」なら、Googleがファイルを読めていません
  • 確認日時が、書き換えたあとか。Googleは「通常 robots.txt ファイルの内容を最大 24 時間キャッシュに保存します」(解釈のページ)。書き換えた直後は古い内容のままのことがあります。急ぐときはレポートから再クロールをリクエストできますが、ヘルプは「通常は再クロールをリクエストする必要はありません。」としています
  • 問題の数が0か。ヘルプには「エラーの場合、ルールは適用されません。警告の場合は適用されます。」とあります。ファイルをクリックすると、前回取得された内容と問題のある行を確かめられます

このレポートは「ドメインレベルのプロパティでのみご利用いただけます」とされていて、ドメインプロパティか、パスの付かないURLプレフィックス(https://example.com/ など)のプロパティで見られます。

手順3:主な記事をURL検査にかけ「クロールを許可?」を見る

robots.txtレポートは、ファイルが読めたかを見る画面です。特定の記事がGoogleに止められていないかは、URL検査で確かめます。よく読まれている記事のURLを入れ、結果の中の「クロールを許可?」という項目を見ます。ヘルプには「[クロールを許可?] が [いいえ] の場合、Google によるページのクロールをブロックする robots.txt ルールが原因で Google がこのページをクロールできないことを意味しています。」とあります(英語版でも同じ内容を確認しました)。

最初に出る結果は、ヘルプによると「これはライブテストではありません。」で、前回インデックスに登録したときの状態です。書き換えたあとの今の状態を見るには、同じ画面の「ライブテスト」を押して、テスト結果の「クロールを許可?」が「はい」になっているかを確かめます。

手順4:1〜2週間後に、表示回数を前の期間と比べる

最後に、Search Consoleの検索パフォーマンスで、書き換えた日の前と後の表示回数を、同じ長さの期間で比べます(比べ方の注意はサーチコンソールの期間比較で間違えやすいこと、同じ長さで比べるに書きました)。あわせて、ページのインデックス作成のレポートで「robots.txtによりブロックされました」が増えていないかも見ます。この項目の読み方は「robots.txtによりブロックされました」は取りに行かなかったという報告ですにあります。

表示回数が落ちておらず、ブロックの件数も増えていなければ、Googlebotは巻き込んでいないと見てよいでしょう。AIのクローラーを止めても、Google検索の数字は止める前と同じ物差しで読めます。

このサイトはAIのクローラーを止めていない

このブログ(rewrite-radar.com)のrobots.txtは、2026年10月9日時点で「User-Agent: *」に対して「Allow: /」と「Disallow: /api/」、それにサイトマップの場所を書いているだけで、AIのクローラーを名前で止める指定はしていません。

このサイトは自分が作ったツールを知ってもらうために書いているので、AIの検索から読者が来る道をふさぐ理由が今はありません。学習用の名前だけを止めるかどうかは、各社の説明が変わったときに考え直します。止める・止めないは、何のためにブログを書いているかで答えが変わるところです。

よくある質問

Google-Extendedを止めると、AIによる概要(AI Overview)に出なくなりますか

Googleの「AI 機能とウェブサイト」によると、AIによる概要はGoogle検索の一部で、アクセスの管理はGooglebotのrobots.txtで行います。Google-Extendedは「Google の他のシステム」での学習とグラウンディングのための名前として、別に案内されています。AIによる概要から外れたいときに使うのは、Search Consoleの「検索の生成 AI 設定」の「除外する」で、AIモードとDiscoverの生成AI機能からもまとめて外れ、そこからの表示回数とトラフィックも無くなります。

GPTBotやClaudeBotを止めれば、記事が学習に使われなくなりますか

各社の書き方は「使うべきでないことを示す」までです。OpenAIはGPTBotを止めることを、内容を学習に使うべきでないと示すもの(indicates)とし、Anthropicは、ClaudeBotを制限すると将来のコンテンツを学習データから除外すべきであることを示す、と書いています。すでに集められた分や、利用者の操作で取りに来るボットの扱いは別です。このページで書けるのは、各社の文書に書かれている範囲までです。

止めたのに、アクセスログにまだ来ています

すぐには反映されないことがあります。Googleはrobots.txtを通常最大24時間キャッシュし、OpenAIも検索結果について "it can take ~24 hours from a site’s robots.txt update for our systems to adjust" と書いています。日数が経っても来るなら、利用者の操作で取りに来るボットか、名前を偽ったアクセスの可能性があります。Googleを名乗るアクセスが本物かどうかは、Googleのクローラーの一覧から確かめ方のページへ進めます。

使っているブログサービスで、robots.txtを書き換えられません

Googleも、CMSによってはrobots.txtを直接編集できない場合があると書いています。サービスの管理画面やヘルプで、robots.txtやクローラーに関する設定があるかを確かめてください。設定が無ければ、robots.txtでAIのクローラーを止める方法は使えません。

まとめ

  • AIのクローラーは、各社が公開している名前をrobots.txtに書けば名前ごとに止められる。学習用はGPTBot(OpenAI)・ClaudeBot(Anthropic)・Google-Extended(Google)
  • Google-ExtendedはGoogle検索での登録やランキングに影響しないと公式に書かれている。ただし、AIによる概要はGoogle検索の側で、Google-Extendedでは止まらない。外したいならSearch Consoleの「検索の生成 AI 設定」(学習には影響しないとヘルプにある)
  • 「User-agent: *」に「Disallow: /」や、「Googlebot」を止める書き方は、Google検索(AIによる概要を含む)のためのクロールまで止める。AIを止めたいだけなら、Googleについて書くのはGoogle-Extendedだけ
  • 各社の検索用(OAI-SearchBot・Claude-SearchBot・PerplexityBot)を止めると、その会社の検索で出にくくなる(と各社が書いている。言い切りはOpenAIだけ)。利用者の操作で取りに来るボットには、robots.txtが効かない場合がある
  • 止めたら、ブラウザでrobots.txtを開き、robots.txtレポートで「取得済み」と問題0件、URL検査のライブテストで「クロールを許可?」、1〜2週間後に表示回数の順で、Googlebotを巻き込んでいないかを確かめる

以下は、すでに届いている記事のほうだけを扱う、私が作った有料ツールの宣伝です。

robots.txtを確かめてGoogle検索の表示回数が落ちていなければ、次に気にするのは、すでに検索に出ている記事のどれから直すかです。そこを自動でやるツールを作りました。サーチコンソールのエクスポートをZIPのまま置くだけで、掲載順位が4.0〜20.5位のページを拾い、表示回数100回以上は通常判定、30〜99回は参考判定、30回未満は本文中心の監査に分けて、同じ区分の中ではCTR機会差の多い順に並べます。 判定と候補3記事のCTR機会差の確認、そのうち1記事分の診断カードまでは無料です。有料は2,980円(税込)の買い切りで、無料の1件を除いた3記事分の診断カードが対象です。3記事分が揃うとき(判定に出た候補が4件以上のとき)だけご案内します。生成の利用期限は購入から7日間で、月額課金や自動更新はありません。ログインも不要です。 CSVファイルそのものはブラウザの外に出ませんが、診断カードを出すときは選んだ1ページぶんの数値(URL・キーワード・順位・表示回数・CTR)を、タイトル取得を押したときは最大10件のURLを送ります。

⚠️ このツールは、robots.txtの中身やAIのクローラーのアクセス、AIの検索での表示は見ません。読むのはGoogle検索のページごとの平均掲載順位・表示回数・CTRだけなので、Googlebotを止めていないかの確認は、上の手順で自分の画面で行ってください。並べ替えるだけで、順位やクリック数が上がることを約束するものではなく、掲載順位4.0〜20.5位に入るページが無いブログでは、候補が0件になることがあります。

Search ConsoleのZIPで無料判定する

Search ConsoleのZIPを読み込むと、候補の判定と1記事分の診断カードを無料で確認できます。登録は不要です。ZIPが無い場合は、診断カードの見本を確認できます。

この記事の内容をツールにしています

Search Console の「ページ」CSVを貼ると、改善余地のある記事を順番に出します。 判定とご自分の記事1件分の診断カードは無料です。ログイン不要。CSVファイルはアップロードせず、ブラウザ内で解析します。

リライトレーダーで無料診断する

関連する記事

この記事を書いた人

みやこし

ブログのリライトで「どの記事を直すか」を数字で決めるSEOライター向けツールを作っています。 掲載順位ごとの平均クリック率、AI Overviewによるクリック減の補正、タイトルの直し方など。

noteQiitaZenn

ブログの一覧に戻る