如果 AI 助手读不到你的网站,它们就无法推荐你的企业。就这一句话,决定了 robots.txt——一个大多数老板从没打开过的纯文本文件——在悄悄左右你的一部分 AI 可见性。很多网站在不知情的情况下屏蔽了 AI 爬虫:CDN 的默认设置、某个插件的“拦截 AI 机器人”开关、或者 2023 年从某篇博客抄来的 robots.txt 规则,都可能让你在客户如今用来寻求推荐的系统面前彻底隐形。

这是一份 2026 年真正重要的 AI 爬虫参考清单:每个爬虫由谁运营、它拿你的内容做什么、以及想要 AI 可见性的企业应该放行哪些。下文的每个 user agent 都有运营方的官方文档;没有官方文档的,我们会如实说明。

先分清三类 AI 机器人

“AI 爬虫”涵盖三种截然不同的行为,正确的策略也因类别而异:

  • 训练爬虫收集内容用于训练未来的模型。屏蔽它们会限制明天的模型对你的了解;影响缓慢而弥散。
  • 搜索索引爬虫构建 AI 搜索产品实时引用的检索索引。屏蔽它们会把你从联网检索的 AI 回答中移除——对可见性是快速而直接的打击。
  • 用户请求抓取器在有人此刻向助手问起某个页面时访问它。屏蔽它们意味着助手无法核实你说的话——包括潜在客户问“这家企业靠谱吗?”的时候。

对想要获客的企业来说,后两类几乎没有商量余地。第一类才是真正的政策选择。

OpenAI(ChatGPT)

OpenAI 记录了三个机器人(官方文档):

  • GPTBot——训练爬虫。放行它,你的内容才能进入未来 GPT 模型的知识。
  • OAI-SearchBot——构建 ChatGPT 网页搜索背后的索引。屏蔽它可能让你缺席 ChatGPT 带来源链接的回答。如果目标是 AI 可见性,放行。
  • ChatGPT-User——当用户的请求需要访问你的网站时抓取页面。放行它:对面往往是一个真实的潜在客户,离联系你只差一个问题。

Anthropic(Claude)

Anthropic 同样公布了其爬虫,并确认它们遵守 robots.txt(官方文档):

  • ClaudeBot——训练爬虫。
  • Claude-User——响应用户实时请求抓取页面。
  • Claude-SearchBot——为改进 Claude 的搜索结果建立索引。

逻辑与 OpenAI 相同:用户类和搜索类机器人直接决定 Claude 今天能否读到并引用你。

Perplexity

Perplexity 是一个 AI 搜索引擎,它的爬虫全部服务于实时回答(官方文档):

  • PerplexityBot——构建 Perplexity 的搜索索引。
  • Perplexity-User——当用户的问题需要时访问页面。

屏蔽它们等于放弃引用最密集的 AI 平台之一——Perplexity 的回答会突出展示来源链接,这正是企业最想要的曝光形式。

Google(Gemini 与 AI 功能)

Google-Extended 不是独立的爬虫——它是一个 robots.txt 令牌,控制 Googlebot 已抓取的内容能否用于训练 Gemini 模型(官方文档)。两个细节很关键:

  • 屏蔽 Google-Extended 不影响你的 Google 搜索排名,也不影响你是否出现在 AI Overviews 里——那些由常规 Googlebot 规则管辖。
  • 放行它不产生额外抓取流量,因为它搭 Googlebot 现有抓取的便车。

清单的其余部分

  • CCBot(Common Crawl)——非营利组织运营的爬虫,构建开放网络存档(官方文档)。它本身不是 AI 公司,但 Common Crawl 数据历来是许多模型的重要训练来源——屏蔽 CCBot 会降低你在众多实验室起步数据集中的存在感。
  • Meta-ExternalAgent(Meta)——Meta 用于 AI 训练和产品改进的爬虫(官方文档),关系到 WhatsApp、Instagram 和 Facebook 内的 Meta AI。
  • Bytespider(字节跳动)——字节跳动的爬虫,一般认为与其模型训练相关。字节跳动没有为它发布官方文档页面,而且它以抓取激进著称;是否遵守 robots.txt,运营方从未公开确认。我们列出它是为了完整性,而非背书。

你可能在日志里看到的其他代理——Applebot-Extended(Apple 的 AI 训练退出令牌)、Amazonbot、DuckAssistBot 以及各种创业公司的爬虫——都适用同样的三分法:查运营方文档,判断它属于训练、搜索还是用户请求,然后相应决策。

一套合理的默认策略

对以被发现、被推荐为目标的企业:放行所有搜索索引和用户请求机器人,并放行客户常用的主流助手的训练机器人:

  • 放行:GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、Claude-User、Claude-SearchBot、PerplexityBot、Perplexity-User、Google-Extended。
  • 自行权衡:CCBot 和 Meta-ExternalAgent(偏训练用途;为了可见性放行是合理默认,为了内容权利屏蔽也站得住脚)。
  • 自行权衡:Bytespider(无官方文档;如果它的流量困扰你就屏蔽——对多数欧美小企业来说,它的可见性收益很有限)。

由于 robots.txt 默认允许抓取,最常见的修复不是添加 Allow 行,而是删掉安全插件或 CDN 预设为这些 user agent 加上的过宽的 Disallow: /。如果你确实想写显式规则,最小模式是:

User-agent: GPTBot
Allow: /

……逐个机器人重复。根据我们扫描过的网站,提醒一句:有些防火墙会在网络层拦截 AI 爬虫,即使 robots.txt 允许它们——所以 robots.txt 干净不等于访问畅通。要测试真实行为,而不只是检查文件。

30 秒检查你的网站

你可以用我们免费的 AI 爬虫检测器对照这份完整清单审计你的 robots.txt——输入域名,它会逐个机器人显示谁被允许、谁被屏蔽、被哪条规则屏蔽。

如果你偏好终端(或想把检查放进 CI,让部署再也不会悄悄屏蔽 AI),同样的检查也在我们的开源 CLI 里(GitHub):npx rankedbyai crawlers yoursite.com 在 11 个主要 AI 爬虫中任何一个被屏蔽时以非零状态退出。而想知道 AI 助手在能读到你之后究竟怎么谈论你的企业,运行一次免费 AI 可见性扫描

FAQ

我应该屏蔽 AI 爬虫吗?

取决于你的内容对你意味着什么。以内容本身为产品的出版商常常屏蔽训练爬虫来保护授权价值。本地企业恰恰相反:你的内容存在的意义就是被找到,屏蔽客户用来寻求推荐的系统基本上只会伤害你。想走中间路线,可以放行搜索和用户请求机器人、屏蔽训练机器人——上文的分类让这种拆分很容易执行。

放行 AI 爬虫会伤害我的 Google 排名吗?

不会。robots.txt 里的 AI 爬虫规则按 user agent 生效,不影响 Googlebot。Google-Extended 尤其在官方文档中明确说明对搜索排名没有影响——它只控制 Gemini 的模型训练。

怎么知道我的网站现在是否屏蔽了 AI 爬虫?

检查 robots.txt 中针对上述 user agent 的 Disallow 规则(包括一刀切的 User-agent: * / Disallow: /),再用爬虫检测器验证。也别忘了检查 CDN 或安全设置——例如 Cloudflare 提供一键屏蔽 AI 机器人的功能,它独立于 robots.txt 运作。

这些机器人真的都遵守 robots.txt 吗?

OpenAI、Anthropic、Perplexity、Google、Common Crawl 和 Meta 都在文档中声明其所列爬虫遵守 robots.txt。Bytespider 的合规性没有官方说明,且有站长报告其行为不一致——如果屏蔽它对你很重要,考虑用防火墙规则,而不是只依赖 robots.txt。