AI 爬虫清单与管理(GPTBot、PerplexityBot、Google-Extended)

想被 AI 引擎引用,第一步不是写内容,而是确认 AI 爬虫读得到你——很多网站 AIO 做不起来,原因只是某任工程师把 AI 爬虫全 Disallow 了。 你可以用 robots.txt 逐一决定放行或封锁哪些 AI 爬虫,但前提是先认得它们的真实 user-agent。本文整理 2026 年主要的六只,并给出可直接套用的设置。

主要 AI 爬虫清单(真实 user-agent)

截至 2026 年,你最该认得的 AI 爬虫有六只,分属不同用途:

User-agent 所属 主要用途
GPTBot OpenAI 抓取内容供模型训练
OAI-SearchBot OpenAI 供 ChatGPT 搜索实时检索
PerplexityBot Perplexity 供 Perplexity 检索与引用
Google-Extended Google 控制内容是否供 Gemini/AI 产品使用
ClaudeBot Anthropic 抓取内容供 Claude 使用
Bingbot Microsoft Bing 索引(同时驱动 Copilot)

注意两个常见误解:Google-Extended 不是一般 Googlebot——挡掉 Google-Extended 不影响你在 Google 一般搜索的排名,只影响是否供 Gemini 等 AI 产品使用。而 Bingbot 同时服务 Bing 搜索与 Copilot,挡掉它等于同时放弃两者。

放行还是封锁?先想清楚你的目标

这是一个取舍,不是「全放」或「全挡」的二选一:

关键认知:封锁爬虫=放弃被该引擎引用的曝光。对多数想成长的内容网站,「放行检索、保留曝光」通常利大于弊。

robots.txt 范例(可直接改用)

放在 https://你的域名/robots.txt。以下示范「放行 AI 检索、保留曝光」的常见设置:

# 放行 OpenAI 检索(供 ChatGPT 搜索引用)
User-agent: OAI-SearchBot
Allow: /

# 放行 Perplexity
User-agent: PerplexityBot
Allow: /

# 放行 Google 的 AI 使用(供 Gemini/AI Overview)
User-agent: Google-Extended
Allow: /

# 放行 Bing(同时供 Copilot)
User-agent: Bingbot
Allow: /

# 一般爬虫
User-agent: *
Allow: /
Sitemap: https://你的域名/sitemap.xml

若要封锁训练型(不想被拿去训练,但仍想被检索引用),可加:

# 不供模型训练
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

原则:检索型放行以保曝光,训练型依你的版权立场决定。 别无差别地一律 Disallow。

检查与验证:三个动作

  1. 看现有 robots.txt:直接开 你的域名/robots.txt,确认没有残留的 User-agent: * Disallow: / 或把上述爬虫全挡的旧设置。
  2. 查服务器日志:在 access log 搜索上述 user-agent,确认它们真的有来抓,且响应是 200 而非 403/404。
  3. 检查是否需要 JavaScript:多数 AI 爬虫不执行 JavaScript。若你的重要内容要 JS 才渲染得出来,爬虫即使放行也读不到——这是常见致命伤。

常见问题(FAQ)

Q1:挡掉 GPTBot,ChatGPT 就一定引用不到我吗? GPTBot 主要供训练;ChatGPT 搜索的实时检索主要靠 OAI-SearchBot。若你想被 ChatGPT 搜索引用又不想被训练,可放行 OAI-SearchBot、封锁 GPTBot。两者要分开设置。

Q2:挡掉 Google-Extended 会影响我的 Google 排名吗? 不会。Google-Extended 只控制内容是否供 Gemini 等 AI 产品使用,与一般 Googlebot 的搜索索引、排名是分开的。挡它不影响传统 SEO,只影响 AI 曝光。

Q3:robots.txt 挡得住所有爬虫吗? robots.txt 是「约定」而非强制。主流合规爬虫(上述六只)会遵守,但它靠自律。真要技术性阻挡,需搭配服务器层的 user-agent 过滤,而非只靠 robots.txt。

Q4:我全部放行会有风险吗? 主要风险是内容被用于模型训练(版权/竞争考量)。若你的内容是公开教学、想扩大曝光,全放行通常合理;若是付费或机密内容,就该封锁对应爬虫。取舍看你的商业模式。


爬虫读得到,是被 AI 引用的地基——这一步没做好,内容写再好也白费。GeoSeoToday把爬虫检查、可见度追踪整理成一站——总整理见 AIO 完整指南,工具入口见 /zh-hans/aio/。延伸阅读:llms.txt 是什么,以及如何被 Gemini/Google AI 引用。