仪表盘中的 AI 爬虫 面板完全基于公开信号构建:robots.txt 对已知 AI 爬虫的放行策略、是否发布了 llms.txt,以及扫描存储的 AI 回答引用你域名的频次。这是诚实的可达性数据——但它不是爬虫流量。真实的 AI 爬虫请求次数只存在于一个地方:你的服务器日志。我们从未接触过这些日志,也不会假装接触过。
如果你的网站部署在 Cloudflare 后面,几分钟内你就可以自己看到真实的 AI 爬虫流量,而无需向任何人开放访问权限。
方案一:AI Audit / AI Crawl Control 面板(最简单)
Cloudflare 为此提供了专门的视图:
- 登录 Cloudflare 控制台 并选择你的站点(zone)。
- 在左侧导航中打开 AI Crawl Control(前身为 AI Audit)。
- 你会看到哪些 AI 爬虫(GPTBot、ClaudeBot、PerplexityBot、Google-Extended 等)请求了你的页面、频次多少、访问了哪些路径——全部基于 Cloudflare 边缘节点上的真实请求统计。
在同一界面你还可以放行或屏蔽单个 AI 爬虫。屏蔽前请记住取舍:读不到你网站的爬虫也无法引用它。
方案二:Security → Bots 分析
任何套餐下,Security → Bots 都会按已验证的爬虫名称分类展示爬虫流量。按你关心的 AI 爬虫筛选,即可查看请求量随时间的变化。它比 AI Crawl Control 粗略,但所有套餐都可用。
方案三:Logpush 导出原始日志(Enterprise)
如果你需要按请求粒度的原始记录——用于自建仪表盘或长期留存——Cloudflare 的 Logpush 可以把 HTTP 请求日志(包含 User-Agent 头)推送到你自己的存储(R2、S3 等)。按已知 AI 爬虫的 user-agent 字符串过滤这些日志,即可得到精确的按爬虫计数。此功能需要 Enterprise 套餐。
与 AI 爬虫面板的关系
- 我们的面板回答的是:AI 爬虫能否到达你的网站(robots.txt、llms.txt),以及扫描中的 AI 回答是否真的引用了你。
- 你的 Cloudflare 日志回答的是:哪些 AI 爬虫真的请求了你的页面,频次多少。
两者互为补充。如果 Cloudflare 显示大量 GPTBot 流量而扫描显示引用很少,说明你的内容被读取了但不被认为值得引用。如果我们的面板显示有爬虫被屏蔽,那么在 robots.txt 放行它们之前,再多的日志分析也无济于事。
我们不要求你与我们共享任何这些数据。流量是你的,你应当直接看到它。