Falcon Information — ホームに戻る

AIによる爬虫(ウェブスクレイピング)のリスト作成と robots.txt の設定に関するガイド

AIによるウェブサイトのスクレイピングは、どこまで許容されるのか? この問題に対する普遍的な答えはありません。なぜなら、「AIスクレイピング」は単一の技術ではなく、トレーニング用、検索・検索用、またはユーザーによるリアルタイムな読み取り用など、さまざまな目的で使用される代理サーバーであり、その制御方法とブロックの影響は大きく異なるからです。本稿では、まずスクレイピングの種類を明確にし、その後、意思決定のためのフレームワークを提供し、最後に、当サイトがどのような選択をし、その理由を公表します。

この記事のセクション

  • ·爬虫類の3つの種類
  • ·主な爬虫類のリスト
  • ·意思決定のフレームワーク
  • ·当サイトでの選択
  • ·具体的な手順とよくある間違い

まず、それぞれの用途を区別し、その後、開放または制限について議論する。

第一種はトレーニング型:コンテンツを収集し、モデルのトレーニングに使用します(例:GPTBot、ClaudeBot)。これは、「特定のコンテンツが将来のトレーニングデータに含まれないようにする」という意味ですが、過去に行われたトレーニングや、第三者の再利用については制御できません。 第二種は検索インデックス型:AIによる検索のためのインデックスとソースへのリンクを構築します(例:OAI-SearchBot、PerplexityBot)。これは、そのプラットフォームでの検索結果が見えない状態にするという意味です。 第三種はユーザーエージェント型:ユーザーが対話中に特定のURLの読み取りを要求した場合の即時取得(例:ChatGPT-User、Perplexity-User)。Perplexityの公式説明によると、この種の要求はユーザーの行動であり、robots.txtによる制御は通常適用されません。ただし、サーバー側での制御のみが可能です。 さらに、Google-ExtendedとApplebot-Extendedは、独立したスクレイピングではなく、robots.txt内の制御代号であり、それぞれGeminiのトレーニングに使用できるコンテンツの制御と、Appleのモデルトレーニングに使用できるコンテンツの制御を行います。実際には、GooglebotとApplebotがコンテンツを取得しています。

主要AIウェブスクレイピングツール一覧

各プラットフォームの公式ドキュメントに基づいて整理(用途の定義は公式ドキュメントに準拠。プラットフォームのポリシー変更により更新される可能性があります)。

主要なAIによるスクレイピングとブロックの影響
名称所属種類封鎖による主な影響
GPTBotOpenAIトレーニングこの情報は、モデルの学習には使用されません。また、ChatGPT の検索機能に影響を与えません。
OAI-SearchBotOpenAI検索インデックスChatGPT で検索した情報源へのリンクを解除する
ChatGPT-UserOpenAIエージェントユーザーが読み取りを要求したが、拒否された。
ClaudeBotAnthropicトレーニングこの内容は、Claudeの学習に使用しないでください。
PerplexityBotPerplexity検索インデックスPerplexity の発生源に関する情報
Google-ExtendedGoogle訓練における制御コードGemini のトレーニングには使用されません。また、Google の検索機能や AI の概要機能に影響を与えません。
Applebot-ExtendedApple訓練における制御コードApple のモデルのトレーニングには使用しないでください。
AmazonbotAmazon索引/アシスタントアレクサなどのサービスの利用制限
CCBotCommon Crawl公開された資料集Common Crawl(多くのモデルの学習データソース)からの退出

意思決定のためのフレームワーク:コンテンツのビジネスモデルを分析する

判断軸線は「AIがコンテンツを読み取った後、あなたが得ること、失うこと」です。公開マーケティングコンテンツ(サービス説明、事例、記事):目的は、コンテンツが見つかりやすく、検索型とユーザー代理型はほぼリスクがないこと。トレーニング型は、ブランドの立場を重視します。有料コンテンツとオリジナルデータベース:コンテンツ自体が商品であり、トレーニング型は合理的な設定です。検索型は、コンテンツの漏洩よりも誘導価値が大きいかどうかを検討します。メディアと出版:ライセンス交渉が重要な要素であり、交渉において、コンテンツの制限は交渉の材料となることがあります。共通の原則:これは逆転可能な政策決定であり、一度の技術決定ではありません。まず、ある立場を選択し、毎季度見直します。

当サイトにおける選択の基準:すべての項目を公開する理由

当サイトのrobots.txtは、GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、PerplexityBot、Google-Extended、Applebot-Extended、Amazonbotのすべてに対して公開されています。その理由は非常にシンプルです。当サイトはB2Bサービスサイトであり、コンテンツの唯一の目的は、潜在的な顧客が当サイトを見つけ、当サイトの信頼性を判断することです。AIプラットフォームが当サイトのコンテンツを参照してユーザーからの質問に回答する場合、これは当サイトにとって露出の機会であり、損失ではありません。 また、インデックスされないページ(例:草稿、個人ページ)については、robots.txtではなく、ページレベルのnoindex機能を使用して制御しています。この2つの仕組みの違いについては、次の段で説明します。

具体的な手順とよくある間違い

最初の一般的な誤り:robots.txt をプライバシー保護のツールと誤解する。robots.txt は、特定のウェブサイトのクロールを制限するものであり、アクセス制御ではありません。機密性の高いコンテンツには、ログインと権限保護が必要です。 2つ目は、クロールとインデックスの混同。robots.txt はクロールを制限しますが、「noindex」を使用することで、検索エンジンにそのページをインデックスしないように指示できます。しかし、robots.txt でクロールを制限されたページには、Google が「noindex」の指示を見つけることができません。 3つ目は、誤った対象へのブロック。Google-Extended をブロックしても検索結果には影響しませんが、Googlebot を誤ってブロックすると、検索結果からそのページが除外されます。そのため、robots.txt の設定を変更する前には、必ず Google Search Console の robots.txt レポートで確認する必要があります。 4つ目は、WAF による誤ったブロック。ファイアウォールルールが、robots.txt で許可されているクロールをブロックしてしまう可能性があります。そのため、実際のアクセス状況を確認するために、サーバーのログや、Google が公式に認めている IP アドレスリストとの照合が必要です。

参考文献

よくある質問

GPTBotを停止した場合、そのコンテンツがChatGPTに表示されることは全くないのでしょうか?
完全に消滅することはありません。GPTBotは、将来の学習データの収集にのみ焦点を当てています。ChatGPTで検索された情報や、OAI-SearchBotのインデックス、過去に学習モデルに組み込まれたデータ、およびサードパーティのウェブサイトからの再掲載コンテンツも影響を受けません。それぞれを個別に制御する場合、どのような利用を制限したいのかを明確にする必要があります。
「Google-Extended」をブロックすると、Googleの検索順位に影響が出ますか?
Googleの公式ドキュメントによると、Google-Extendedは、Geminiなどのモデルのトレーニングに使用されるコンテンツを制御するものであり、Google検索のクローリング、インデックス作成、ランキングに影響を与えるものではありません。また、AI Overviewは、一般的なGooglebotのインデックスを使用しています。
robots.txt の設定変更は、いつから適用されますか?
robots.txt の再取得を待つ必要があります。各社の頻度は異なるため、Google は通常 24 時間以内に更新されます。変更後、GSC の robots.txt レポートで Google が取得したバージョンを確認できます。また、他のプラットフォームでは、サーバーのログを確認して、実際のアクセス状況を確認してください。
どのようにして、本当に爬虫類であるか、あるいは単なる偽物であるかを判断すればよいでしょうか?
ユーザーエージェント文字列は偽装可能です。OpenAI、Google、Perplexityなどは、公式なIPアドレス範囲を公開しています。より厳密な対策としては、サーバーまたはWAFでIPアドレスを照合検証し、検証に合格したリクエストのみに許可ルールを適用する方法があります。

関連するご要望はありますか?

お問い合わせ