隼讯数位行销 — 回首页

AI 爬虫清单与 robots.txt 决策

该不该让 AI 爬虫抓你的网站?这个问题没有通用答案,因为「AI 爬虫」不是一种东西——训练用、搜索索引用、使用者即时读取用的代理,控制方式与封锁后果完全不同。本文先把类型分清楚,再给决策框架,最后公开本站自己的选择与理由。

本文章节

  • ·三种爬虫类型
  • ·主要爬虫清单
  • ·决策框架
  • ·本站的选择
  • ·实践细节与常见错误

先分清三种用途,再谈开放或封锁

第一类是训练型:收集内容用于模型训练,如 GPTBot、ClaudeBot;封锁它表达的是「不同意内容进入未来的训练资料」,但管不到已经发生的训练与第三方转载。第二类是搜索索引型:建立 AI 搜索的索引与来源连结,如 OAI-SearchBot、PerplexityBot;封锁它等于退出该平台的搜索能见度。第三类是使用者代理型:使用者在对话中要求读取特定网址时的即时抓取,如 ChatGPT-User、Perplexity-User;依 Perplexity 官方说明,这类请求属使用者行为,一般不受 robots.txt 控制,要挡只能靠服务器端。另外有两个特例:Google-Extended 与 Applebot-Extended 不是独立爬虫,而是 robots.txt 中的控制代号,分别管内容能否用于 Gemini 训练与 Apple 的模型训练——实际抓取的仍是 Googlebot 与 Applebot。

主要 AI 爬虫清单

依各平台官方文件整理(用途定义以官方文件为准,会随平台政策更新):

主要 AI 爬虫与封锁影响
名称所属类型封锁的主要影响
GPTBotOpenAI训练内容不用于模型训练;不影响 ChatGPT 搜索
OAI-SearchBotOpenAI搜索索引退出 ChatGPT 搜索的来源连结
ChatGPT-UserOpenAI使用者代理使用者要求读取时被拒
ClaudeBotAnthropic训练内容不用于 Claude 训练
PerplexityBotPerplexity搜索索引退出 Perplexity 的来源呈现
Google-ExtendedGoogle训练控制代号不用于 Gemini 训练;不影响 Google 搜索与 AI Overview
Applebot-ExtendedApple训练控制代号不用于 Apple 模型训练
AmazonbotAmazon索引/助理Alexa 等服务的引用受限
CCBotCommon Crawl公开资料集退出 Common Crawl(许多模型的训练资料源)

决策框架:看内容的商业模式

判断的轴线是「内容被 AI 读取后,你得到什么、失去什么」。公开行销内容(服务说明、案例、文章):目的本来就是被找到,开放搜索型与使用者代理型几乎没有下档风险,训练型看品牌立场。付费内容与原创数据库:内容本身就是商品,封锁训练型是合理预设,搜索型看导流价值是否大于内容外泄。媒体与出版:授权谈判是核心考量,封锁常是谈判筹码的一部分。共通原则:这是可逆的政策决定,不是一次性的技术决定——先选一个立场,每季检视。

本站的选择:全面开放,理由如下

本站的 robots.txt 对 GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、PerplexityBot、Google-Extended、Applebot-Extended、Amazonbot 全部开放。理由很直接:我们是 B2B 服务网站,内容的唯一目的是让潜在客户找到我们、判断我们可不可信——AI 平台引用我们的内容回答使用者问题,对我们是曝光不是损失。同时要说明:不想被索引的页面(如草稿、个人页)我们用页面层级的 noindex 控制,而不是 robots.txt——这两个机制的差异在下一段。

实践细节与常见错误

第一个常见错误:把 robots.txt 当成隐私工具。robots.txt 只挡守规矩的爬虫抓取,不是存取控制——敏感内容要用登入与权限保护。第二个:搞混抓取与索引。robots.txt 挡抓取;不想被收录要用 noindex,而且被 robots.txt 挡住的页面 Google 反而读不到它的 noindex 标记。第三个:封错对象。封 Google-Extended 不影响搜索,但误封 Googlebot 会直接掉出搜索结果,改 robots.txt 前后都要用 GSC 的 robots.txt 报告验证。第四个:WAF 误挡。防火墙规则可能在 robots.txt 放行的同时把爬虫挡在门外,要用服务器纪录与官方 IP 清单核对实际存取。

参考资料

常见问题

封了 GPTBot,内容就完全不会出现在 ChatGPT 吗?
不会完全消失。GPTBot 只管未来的训练资料收集;ChatGPT 搜索的引用走 OAI-SearchBot 索引,已训练进模型的历史资料与第三方网站转载的内容也不受影响。要分别控制,先想清楚你要挡的是哪一种使用。
封锁 Google-Extended 会影响 Google 搜索排名吗?
依 Google 官方文件,不会。Google-Extended 只控制内容是否用于 Gemini 等模型训练,不影响 Google 搜索的抓取、索引与排名,也不影响 AI Overview——后者用的是一般 Googlebot 的索引。
robots.txt 改了多久生效?
要等爬虫下次重新抓取 robots.txt,各家频率不同,Google 通常在 24 小时内。改完可以用 GSC 的 robots.txt 报告确认 Google 取得的版本,其他平台则观察服务器纪录的实际存取变化。
怎么确认来的是真爬虫不是冒名的?
User agent 字串可以伪造。OpenAI、Google、Perplexity 都公布官方 IP 范围,严谨做法是在服务器或 WAF 用 IP 反查验证,只对通过验证的请求套用放行规则。

有相关需求?

联系我们