AI 爬蟲清單與 robots.txt 決策

該不該讓 AI 爬蟲抓你的網站?這個問題沒有通用答案,因為「AI 爬蟲」不是一種東西——訓練用、搜尋索引用、使用者即時讀取用的代理,控制方式與封鎖後果完全不同。本文先把類型分清楚,再給決策框架,最後公開本站自己的選擇與理由。

本文章節

  • · 三種爬蟲類型
  • · 主要爬蟲清單
  • · 決策框架
  • · 本站的選擇
  • · 實作細節與常見錯誤

先分清三種用途,再談開放或封鎖

第一類是訓練型:收集內容用於模型訓練,如 GPTBot、ClaudeBot;封鎖它表達的是「不同意內容進入未來的訓練資料」,但管不到已經發生的訓練與第三方轉載。第二類是搜尋索引型:建立 AI 搜尋的索引與來源連結,如 OAI-SearchBot、PerplexityBot;封鎖它等於退出該平台的搜尋能見度。第三類是使用者代理型:使用者在對話中要求讀取特定網址時的即時抓取,如 ChatGPT-User、Perplexity-User;依 Perplexity 官方說明,這類請求屬使用者行為,一般不受 robots.txt 控制,要擋只能靠伺服器端。另外有兩個特例:Google-Extended 與 Applebot-Extended 不是獨立爬蟲,而是 robots.txt 中的控制代號,分別管內容能否用於 Gemini 訓練與 Apple 的模型訓練——實際抓取的仍是 Googlebot 與 Applebot。

主要 AI 爬蟲清單

依各平台官方文件整理(用途定義以官方文件為準,會隨平台政策更新):

主要 AI 爬蟲與封鎖影響
名稱所屬類型封鎖的主要影響
GPTBotOpenAI訓練內容不用於模型訓練;不影響 ChatGPT 搜尋
OAI-SearchBotOpenAI搜尋索引退出 ChatGPT 搜尋的來源連結
ChatGPT-UserOpenAI使用者代理使用者要求讀取時被拒
ClaudeBotAnthropic訓練內容不用於 Claude 訓練
PerplexityBotPerplexity搜尋索引退出 Perplexity 的來源呈現
Google-ExtendedGoogle訓練控制代號不用於 Gemini 訓練;不影響 Google 搜尋與 AI Overview
Applebot-ExtendedApple訓練控制代號不用於 Apple 模型訓練
AmazonbotAmazon索引/助理Alexa 等服務的引用受限
CCBotCommon Crawl公開資料集退出 Common Crawl(許多模型的訓練資料源)

決策框架:看內容的商業模式

判斷的軸線是「內容被 AI 讀取後,你得到什麼、失去什麼」。公開行銷內容(服務說明、案例、文章):目的本來就是被找到,開放搜尋型與使用者代理型幾乎沒有下檔風險,訓練型看品牌立場。付費內容與原創資料庫:內容本身就是商品,封鎖訓練型是合理預設,搜尋型看導流價值是否大於內容外洩。媒體與出版:授權談判是核心考量,封鎖常是談判籌碼的一部分。共通原則:這是可逆的政策決定,不是一次性的技術決定——先選一個立場,每季檢視。

本站的選擇:全面開放,理由如下

本站的 robots.txt 對 GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、PerplexityBot、Google-Extended、Applebot-Extended、Amazonbot 全部開放。理由很直接:我們是 B2B 服務網站,內容的唯一目的是讓潛在客戶找到我們、判斷我們可不可信——AI 平台引用我們的內容回答使用者問題,對我們是曝光不是損失。同時要說明:不想被索引的頁面(如草稿、個人頁)我們用頁面層級的 noindex 控制,而不是 robots.txt——這兩個機制的差異在下一段。

實作細節與常見錯誤

第一個常見錯誤:把 robots.txt 當成隱私工具。robots.txt 只擋守規矩的爬蟲抓取,不是存取控制——敏感內容要用登入與權限保護。第二個:搞混抓取與索引。robots.txt 擋抓取;不想被收錄要用 noindex,而且被 robots.txt 擋住的頁面 Google 反而讀不到它的 noindex 標記。第三個:封錯對象。封 Google-Extended 不影響搜尋,但誤封 Googlebot 會直接掉出搜尋結果,改 robots.txt 前後都要用 GSC 的 robots.txt 報告驗證。第四個:WAF 誤擋。防火牆規則可能在 robots.txt 放行的同時把爬蟲擋在門外,要用伺服器紀錄與官方 IP 清單核對實際存取。

參考資料

常見問題

封了 GPTBot,內容就完全不會出現在 ChatGPT 嗎?
不會完全消失。GPTBot 只管未來的訓練資料收集;ChatGPT 搜尋的引用走 OAI-SearchBot 索引,已訓練進模型的歷史資料與第三方網站轉載的內容也不受影響。要分別控制,先想清楚你要擋的是哪一種使用。
封鎖 Google-Extended 會影響 Google 搜尋排名嗎?
依 Google 官方文件,不會。Google-Extended 只控制內容是否用於 Gemini 等模型訓練,不影響 Google 搜尋的抓取、索引與排名,也不影響 AI Overview——後者用的是一般 Googlebot 的索引。
robots.txt 改了多久生效?
要等爬蟲下次重新抓取 robots.txt,各家頻率不同,Google 通常在 24 小時內。改完可以用 GSC 的 robots.txt 報告確認 Google 取得的版本,其他平台則觀察伺服器紀錄的實際存取變化。
怎麼確認來的是真爬蟲不是冒名的?
User agent 字串可以偽造。OpenAI、Google、Perplexity 都公布官方 IP 範圍,嚴謹做法是在伺服器或 WAF 用 IP 反查驗證,只對通過驗證的請求套用放行規則。

有相關需求?

聯絡我們