先分清三種用途,再談開放或封鎖
第一類是訓練型:收集內容用於模型訓練,如 GPTBot、ClaudeBot;封鎖它表達的是「不同意內容進入未來的訓練資料」,但管不到已經發生的訓練與第三方轉載。第二類是搜尋索引型:建立 AI 搜尋的索引與來源連結,如 OAI-SearchBot、PerplexityBot;封鎖它等於退出該平台的搜尋能見度。第三類是使用者代理型:使用者在對話中要求讀取特定網址時的即時抓取,如 ChatGPT-User、Perplexity-User;依 Perplexity 官方說明,這類請求屬使用者行為,一般不受 robots.txt 控制,要擋只能靠伺服器端。另外有兩個特例:Google-Extended 與 Applebot-Extended 不是獨立爬蟲,而是 robots.txt 中的控制代號,分別管內容能否用於 Gemini 訓練與 Apple 的模型訓練——實際抓取的仍是 Googlebot 與 Applebot。