先分清三种用途,再谈开放或封锁
第一类是训练型:收集内容用于模型训练,如 GPTBot、ClaudeBot;封锁它表达的是「不同意内容进入未来的训练资料」,但管不到已经发生的训练与第三方转载。第二类是搜索索引型:建立 AI 搜索的索引与来源连结,如 OAI-SearchBot、PerplexityBot;封锁它等于退出该平台的搜索能见度。第三类是使用者代理型:使用者在对话中要求读取特定网址时的即时抓取,如 ChatGPT-User、Perplexity-User;依 Perplexity 官方说明,这类请求属使用者行为,一般不受 robots.txt 控制,要挡只能靠服务器端。另外有两个特例:Google-Extended 与 Applebot-Extended 不是独立爬虫,而是 robots.txt 中的控制代号,分别管内容能否用于 Gemini 训练与 Apple 的模型训练——实际抓取的仍是 Googlebot 与 Applebot。