AI 爬虫是各家 AI 引擎用来抓取网页、构建检索与训练语料的自动程序,它们通过 robots.txt 里的 User-Agent 名称被识别和管理。 一个网站如果在 robots.txt 里拒绝了 GPTBot,ChatGPT 就永远引用不到它——内容做得再好也没用。

这是 GEO 里唯一一件十分钟能做完、做错了却全盘归零的事,值得单独一篇。

为什么这一项权重最高

Google 在 2026 年 5 月发布的官方文档《AI features and your website》里,把「允许抓取」列为出现在 AI 功能里的第一项要求。同一份文档还写了一句更重要的话:

「你不需要创建新的机器可读文件、AI 文本文件或标记来出现在这些功能中。也没有你必须添加的特殊 schema.org 结构化数据。」

换句话说:很多被 GEO 服务商包装成关键动作的技术改造都不是必需的,但 robots 放行是。 在领航鲸的官网 AI 体检里,「AI 爬虫放行」占 25 分,是七项里权重最高的一项,原因就在这里。

需要放行的 AI 爬虫清单

归属User-Agent用途
OpenAIGPTBot训练语料抓取
OpenAIOAI-SearchBotChatGPT 搜索索引
OpenAIChatGPT-User用户触发的实时访问
AnthropicClaudeBot训练语料抓取
AnthropicClaude-SearchBot检索索引
AnthropicClaude-User用户触发的实时访问
PerplexityPerplexityBot检索索引
PerplexityPerplexity-User用户触发的实时访问
GoogleGoogle-ExtendedGemini 与 AI 功能的语料控制
字节跳动Bytespider豆包 / 头条系抓取
DeepSeekDeepSeekBot检索抓取
阿里YisouSpider神马 / 通义相关抓取
百度Baiduspider百度搜索与文心
苹果Applebot-ExtendedApple 智能语料控制
Metameta-externalagentMeta AI 抓取
亚马逊AmazonbotAlexa / Amazon AI
Coherecohere-ai模型语料抓取
搜狗Sogou web spider搜狗搜索与腾讯生态

⚠ 两点要注意:

  • UA 名称会变。各家会新增或更名(OpenAI 的 OAI-SearchBot 就是后来才加的),建议每季度对照官方文档核一次;
  • Google-ExtendedApplebot-Extended 是「语料控制开关」,不是抓取器。它们不单独抓页面,但 Disallow 它们会让你的内容被排除在对应 AI 功能之外。

三个最常见的误封写法

一、通配规则一刀切。 很多站点为了防采集写了:

User-Agent: *
Disallow: /

这一条就把所有 AI 爬虫全挡在门外了。

二、只允许了搜索引擎。 robots 是几年前配的,只显式允许 Googlebot 和 Baiduspider,其他一律 Disallow。GPTBot 那时候还不存在,自然不在白名单里。

三、把内容目录连带封了。 为了保护后台写了 Disallow: /a,结果把 /article/ 也一起封了——robots 的 Disallow 是前缀匹配,不是目录匹配,这是最隐蔽的一种。

一份可直接抄的模板

原则是:内容页全放行,交互页和后台全封。交互页对 AI 没有价值,还会浪费抓取预算。

User-Agent: GPTBot
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /login
Disallow: /signup

# …对上表每个 UA 重复一组…

User-Agent: *
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /login
Disallow: /signup

Sitemap: https://你的域名/sitemap.xml

三个要点:

  • 最后必须留一组 User-Agent: * 兜底,新出现的爬虫才有默认规则;
  • Sitemap: 那一行不属于任何 UA 分组,放文件末尾即可;
  • 每组规则之间要有空行,没有空行会被解析成同一组,这是 robots 语法里最容易写错的地方。

四步自查,十分钟

  1. 访问 你的域名/robots.txt,确认上表里的 UA 没有被 Disallow;
  2. 查看首页源代码(右键「查看网页源代码」,不是「检查元素」),搜一句首页正文——搜不到说明正文由 JavaScript 渲染,AI 爬虫不执行 JavaScript,拿到的是空壳;
  3. application/ld+json,看有没有 Organization 结构化数据(不是必需,但有用);
  4. 访问 你的域名/sitemap.xml,确认返回 200 且包含全部内容页。

第 2 步的优先级高于第 3、4 步。robots 放行了但正文在 JS 里,等于开了门却把东西锁在保险柜里。

放行之后能观察到什么

放行只是入场券,真正的验证要看服务器日志或埋点里的爬虫访问记录。一个真实的参考:领航鲸官网在完成 robots 配置后的首个统计窗口内,共记录到 7 次 AI 爬虫抓取,其中 6 次落在首页、1 次落在列表页,文章详情页 0 次

这个分布说明了一件事:爬虫是从首页进的,内容页离首页越远越难被发现。 我们据此把学堂精选文章的直链放上了首页,把内容页从二跳变成一跳。Google 官方文档里「内容能通过站内链接被发现」这一条要求,说的就是这件事。

常见疑问

问:放行 AI 爬虫等于把内容白送给大模型训练吗?

是的,这是一个真实的权衡。想被 AI 引用,就必须被 AI 读到。折中做法是放行检索类爬虫(OAI-SearchBot、PerplexityBot、Claude-SearchBot)、限制纯训练类爬虫(GPTBot、ClaudeBot),但代价是训练语料那条通路会关闭。多数中小品牌的合理选择是全部放行。

问:robots 改完多久生效?

爬虫重新读取 robots.txt 通常在 24 小时内,但重新抓取内容页可能需要数天到数周。

问:有没有比 robots 更强的控制手段?

有,服务端按 UA 拦截。但 robots 是各家都遵守的公开协议,先用它;UA 拦截容易误伤,且部分 UA 可伪造。

---

领航鲸的官网 AI 体检会自动跑完上面四步,逐条列出被封的爬虫、正文是否在服务端 HTML 里、sitemap 与结构化数据是否齐全,并给出整改建议。免费体检一次只要十分钟。

延伸阅读:llms.txt 有用吗:让 AI 读懂你官网的三件套什么是 GEO怎样写出 AI 愿意引用的内容

参考资料:Google《AI features and your website》OpenAI GPTBot 说明Google robots.txt 规范