做 GEO 的人最常问的第一个问题是「我该写什么内容,AI 才会提到我」。这个问题问早了。
你问 AI 一个需要新信息的问题——某个品牌口碑如何、某类产品哪家好——它背后通常做这么几件事:把你的话改写成若干条检索词,去一个搜索索引里检索,取回一批网页,读完之后写成一段话给你。AI 引擎大多没有一份属于自己的全网索引,它们把检索这件事交给搜索引擎。
所以你的页面能不能被引用,先取决于它在不在那个索引里。GEO 的第一公里不在 AI 那边,在搜索引擎这边。
而从「页面躺在你的服务器上」到「被 AI 摘进一段答案」,中间要过五道关。每一关判的是完全不同的一件事,任何一关过不去,后面做得再好都不成立。
(GEO 是什么、和 SEO 有什么区别,见什么是 GEO。这篇只讲那五道关。)
一、第一关 · 发现:引擎知不知道有这个地址
这一关在判什么: 这个网址在不在引擎的待抓队列里。
引擎不会凭空知道你发了一篇新文章。它得先从某处拿到这个网址,来源通常是三种:别的页面上的链接、你提交的站点地图、你主动推送的接口。
最常见的误解:以为提交了就等于收录了。
这三条路没有一条能保证什么,它们做的只有一件事——把地址放进待抓队列。推送接口返回成功,说明的是「引擎知道有这个地址了」,不是「引擎认为它值得抓」。这两件事之间的落差有多大,我们用一批真实网址实测过,见主动推送与 IndexNow 能做什么,不能做什么。
过不去时是什么表现: 站长平台里查不到这个网址,服务器日志里也从来没有任何爬虫取过它。
→ 展开见站点地图到底做什么。
二、第二关 · 抓取:知道了地址,去不去取
这一关在判什么: 引擎要不要真的发一个请求,把这个页面下载下来。
有两样东西在这一关说话。一是 robots.txt,你在上面声明哪些路径欢迎抓、哪些不欢迎;二是抓取预算,引擎分给你这个站的抓取量是有限的,这些额度花在哪些页面上,由它自己算。
最常见的误解:把 robots.txt 当成权限控制。
它不是锁,是一份声明。守规矩的爬虫会读它并照办,不守规矩的直接无视——真要挡住,得靠鉴权或者服务端拦截。
还有一件很多人不知道的事:robots.txt 直到 2022 年 9 月才由 IETF 以 RFC 9309 正式确立为标准。在那之前的二十多年,它一直只是一份被广泛遵守的君子协定。各家对细节的处理至今仍有出入,根子就在这里。
过不去时是什么表现: 日志里爬虫来过,但只取了 robots.txt 就走;或者反复抓一些无关紧要的地址,正文页一个都不碰。
→ 展开见robots.txt 怎么读与抓取预算是什么。
三、第三关 · 索引:取到了,存不存
这一关在判什么: 这个页面值不值得被存进索引库。
引擎抓到页面之后不会照单全收。它会判重、判质量,在一组内容相同或高度相似的地址里挑一个存下来,其余的丢掉或者合并过去。
最常见的误解:以为 canonical 是命令。
canonical 标签是你告诉引擎「这几个地址里,我认为这个才是正主」。但它是建议不是指令——引擎会参考,也会不听,而且不听的情况并不罕见。一旦它选了和你不一样的那个地址,你精心优化过的那一版就不在索引里。
过不去时是什么表现: 日志显示明明抓过,站长平台的索引量却不涨;或者用 site: 搜出来的是一个你根本没打算让人看到的参数地址。
→ 展开见同一篇内容有多个地址会怎样。
四、第四关 · 检索与排序:存了,被不被检索到
这一关在判什么: 有人问相关问题时,你这一页会不会被翻出来。
进了索引不等于会被翻出来。索引库里躺着天量的页面,一次检索只取回其中很小的一批。
这一关在 AI 时代变化最大,也最容易被误读。
传统搜索里,排第 1 和排第 8 是两个世界——目光和点击高度集中在最前面几条,于是整个 SEO 行业围着「进前三」打。
AI 检索不是这样。它取回的是一批而不是一条,然后把这一批整个读进去,再写答案。所以排在这批里的第 6 位和第 1 位,差距远比 SEO 时代小,两条都被读到了。
但这不等于排名不重要了。排在第 30 位依然等于不存在,因为它压根没被取回来。准确的说法是:排名的意义变了,不是消失了。以前排名决定「有没有人点你」,现在排名决定「你有没有被放进那一批候选」。
过不去时是什么表现: 收录一切正常,但拿你自己文章里的原话去问,AI 引用的是别人。
→ 展开见收录和排名不是一回事。
五、第五关 · 摘引:被读到了,摘不摘
这一关在判什么: 读完那一批网页之后,AI 决定从哪几段里取话。
这一关是 GEO 独有的,SEO 时代不存在——那时候只要排上去,剩下的是用户自己点进来读。现在多了一道:AI 要从读到的内容里挑出几句拼成答案,你的段落得让它敢挑。
最常见的误解:以为内容写得好就会被摘。
判据不是「好」,是能不能独立成段。被摘走的那句话会脱离原文、出现在一段完全不同的上下文里,所以 AI 敢摘的,是那种离开上下文依然成立的句子:一个完整的定义、一条带条件的结论、一组问答。
反过来,「如上所述……」「在这种情况下……」这类承接句永远不会被摘走,因为它们离开前文就不知所云。同一篇文章里,写法直接决定了哪些段落有机会、哪些段落注定沉底。
结构化数据在这一关帮的忙,是把「哪一段是问、哪一段是答」明明白白标给机器看。
过不去时是什么表现: AI 回答时确实引了你的站,但引的是首页,或者一段跟问题没什么关系的话。
→ 展开见结构化数据入门与怎样写出 AI 愿意引用的内容。
六、谁在给谁供索引
上面五道关,前四关全都发生在搜索引擎那一侧。而不同的 AI 引擎,背后接的搜索索引并不是同一个:
| 搜索引擎 | 它的索引在喂 | 对应的站长平台 |
|---|---|---|
| 百度 | 文心一言 | ziyuan.baidu.com |
| 头条搜索 | 豆包 | zhanzhang.toutiao.com |
| 神马(UC / 夸克) | 通义千问 | zhanzhang.sm.cn |
| Bing | ChatGPT / Copilot | IndexNow,唯一一条不需要站点验证的 |
| Gemini / AI Overviews | Search Console | |
| 360 | 360AI | zhanzhang.so.com |
这张表的用处是告诉你该去哪个站长平台。想让豆包看见你,光盯着豆包没用,得先让头条搜索抓到你。
⚠ 但边界要说清楚:这是「谁的索引喂谁」,不是「进了这个索引就一定会被那个 AI 引用」。 进索引是必要条件,不是充分条件——后面还压着第四关和第五关。
顺带一提,各家爬虫在同一个站上的实际表现差别极大:同一批内容、同一个时间窗口,有的引擎抓走上百个正文页,有的一个都没进。完整口径与实测数据见爬虫到访观测 2026-08 期。
七、基础 SEO 没有过时,它换了收款人
回过头看这五道关:发现、抓取、索引、检索、摘引。前四关几乎全是 SEO 干了二十年的老活——站点地图、robots.txt、抓取预算、重复地址。真正新增的只有第五关。
所以「AI 来了,SEO 就没用了」这个判断是错的。准确的说法是:动作大部分没变,判据变了。
以前你做这些,是为了排在第 3 位拿到点击;现在你做同样的事,是为了在 AI 摘引的候选池里占一席。以前看排名和流量,现在看 AI 答的那段话里有没有你。
如果只挑三件不花钱就能做的,是这三件:
- 检查
robots.txt有没有误挡。 尤其是 AI 爬虫那一批 UA,它们和搜索爬虫不是一回事,挡错了等于对 AI 隐身(可直接抄的清单见AI 爬虫 robots.txt 配置清单) - 把站点地图的地址写进
robots.txt。 有些引擎不提供推送接口,只认这一条路 - 别让 JavaScript 当唯一入口。 一个只在脚本里出现、没有任何页面链过去的地址,爬虫爬到那儿就是死胡同(三条发现链路见AI 爬虫是怎么发现你的网站的)
这三件做完,第一关和第二关基本就通了。剩下三关怎么过,在这一簇后面几篇里展开。
常见疑问
问:做 GEO 是不是就不用管 SEO 了?
反过来。GEO 的前四关——发现、抓取、索引、检索——全是 SEO 的老活,一关都绕不过去。变的是判据:以前做这些是为了排名和点击,现在做这些是为了进 AI 的候选池。真正新增的只有第五关,也就是怎么写才容易被整段摘走。
问:搜索引擎收录了,是不是就等于 AI 能看到?
不等于。收录只过到第三关。后面还有第四关(有人问相关问题时,你会不会被检索出来)和第五关(被读到之后,你的段落值不值得被摘)。这三关中断任何一环,结果都是 AI 的答案里没有你。
问:网站怎么才能被 AI 收录?
严格说没有「被 AI 收录」这件事,AI 引擎大多不维护属于自己的全网索引。你要做的是让它背后那个搜索引擎收录你:去对应的站长平台验证站点、提交站点地图、有推送接口就用推送接口。哪个 AI 对应哪个搜索引擎,见上面第六节那张表。
问:为什么 AI 搜不到我的网站?
先定位卡在第几关,别一上来就改内容。查法是:服务器日志里有没有爬虫来过(第一、二关)→ 站长平台的索引量涨没涨(第三关)→ 拿自己文章里的原话去搜,能不能搜到自己(第四关)。前面几关不通,内容写得再好也没用。
问:网站没排名,AI 会引用我吗?
可能会,但概率低很多。AI 检索时取回的是一批结果而不是第一条,所以不必非得排到前三;可排得太靠后就不会被取回来,也就没有被读到的机会。所以排名依然重要,只是「够进候选池」比「必须第一」更接近现在的目标。
---
想知道你的站点被哪些引擎抓到了?免费诊断一次,我们会读你站点的可抓取性与收录状况并给出清单。