问 AI「预算 2000 左右买哪个牌子的咖啡机」,它会干脆地报出三五个品牌、各自的卖点,甚至给出「新手选 A、想玩花式选 B」的结论。这些判断不是凭空来的。理解 AI 的信息来源,是做 GEO 的第一课。
本文里的数据来自领航鲸自己的探测库:截至 2026 年 8 月,564 条成功回答、3490 条引用记录,覆盖 11 个 AI 引擎。样本不算大,但每一条都是真实调用的原始记录,不是二手报告。
AI 回答的两条知识通路
第一条:训练语料(模型「记住」的)。 大模型在训练阶段吞下海量公开文本——百科、新闻、问答社区、电商评价、行业报告。你的品牌在这些语料里出现得多不多、口碑好不好,决定了模型的「底层印象」。这条通路更新以月甚至年计,但影响深:即使不联网,模型也会凭记忆推荐它熟悉的品牌。
第二条:联网检索(模型「现查」的)。 主流引擎回答商业类问题时普遍会实时检索,把搜到的文章塞进上下文再作答。这条通路的更新是分钟级的——今天发的稿,明天就可能被引用。
两条通路的差别决定了投入节奏:
| 训练语料 | 联网检索 | |
|---|---|---|
| 更新周期 | 数月至一年 | 分钟级 |
| 典型载体 | 百科词条、权威媒体报道、高赞问答 | 自媒体文章、行业媒体、榜单、社区帖 |
| 见效时间 | 下一代模型发布后 | 最快次日 |
| 可验证性 | 几乎无法单独归因 | 引用链接可逐条追溯 |
| 适合的投入 | 长期沉淀,不追热点 | 持续产出,按引擎偏好投放 |
实测:并不是每个引擎都告诉你它引了谁
这是做 GEO 之前必须先知道的一件事。同样是回答商业问题,各引擎公开信源的程度差了一个数量级:
| 引擎 | 成功回答数 | 带公开引用的回答 | 公开率 | 平均每条回答的引用数 |
|---|---|---|---|---|
| DeepSeek | 108 | 108 | 100% | 13.8 |
| 通义千问 | 137 | 135 | 99% | 4.8 |
| 文心一言 | 65 | 62 | 95% | 8.7 |
| 豆包 | 94 | 37 | 39% | 10.0 |
| 腾讯元宝 | 66 | 23 | 35% | 15.2 |
数据来源:领航鲸探测库,统计区间截至 2026 年 8 月,样本 564 条成功回答。
这张表的直接结论是:公开率低不等于不检索。豆包只有 39% 的回答带引用,但带引用的那些平均引用 10 条,说明它检索得很积极,只是多数时候不告诉你。对这类引擎,归因只能做到「提及率有没有变」,做不到「哪篇稿子被引了」——做投放计划前先确认这件事,能省掉很多无效期待。
实测:AI 到底在引谁
把 3490 条引用按域名聚合,排在最前面的是这些:
| 站点 | 被引次数 | 有几个引擎引用过 |
|---|---|---|
| k.sina.com.cn(新浪看点) | 173 | 4 |
| baike.baidu.com(百度百科) | 94 | 3 |
| baijiahao.baidu.com(百家号) | 93 | 1 |
| www.cet.com.cn(中国经济网) | 92 | 5 |
| www.sohu.com(搜狐) | 89 | 5 |
| zhuanlan.zhihu.com(知乎专栏) | 60 | 2 |
| www.ithome.com(IT之家) | 51 | 4 |
| blog.csdn.net(CSDN) | 45 | 4 |
「有几个引擎引用过」这一列比「被引次数」更值得看。中国经济网和搜狐被 5 个引擎都引用过,说明它们是跨引擎通吃的站点;而百家号虽然被引 93 次,却只有 1 个引擎在引——押注它等于押注单一引擎。
一位长期做投放的从业者对这个现象的总结很直接:「铺得广不如铺得准,你得先知道那台机器在读谁。」
每家引擎的口味不一样
单看通义千问的信源结构就更明显:648 条引用里,新浪系(k.sina 133 + cj.sina 32)占 25.5%,是它最大的单一来源。一个合理的解释是阿里没有自己的内容平台,通义只能大量吃外部信源;而字节有头条和抖音、腾讯有公众号,它们的引擎更倾向自家生态。
⚠ 这个解释是假设,不是我们验证过的结论。可以作为投放的先验参考,不该当成事实讲给客户。
品牌能影响什么:两类动作
- 影响联网检索(见效快):在目标引擎爱引用的平台持续产出「回答式内容」——直接回应「怎么选」「哪家好」的文章,被引用概率远高于硬广。
- 影响训练语料(见效慢,复利大):百科词条、权威媒体报道、高赞问答会进入下一代模型的训练集。今天的沉淀,是明年模型「记忆」里的你。
普林斯顿等机构在 KDD 2024 发表的《GEO: Generative Engine Optimization》用约 1 万条查询做了对照实验,结论是:引用来源、加入引语、加入统计数字这三类改动,能把内容在 AI 回答中的可见度提升最高 40%,而关键词堆砌这类传统 SEO 手法在生成式引擎里基本无效。这与我们自己的观察一致——被反复引用的内容,几乎都是带数据、带出处、结构清楚的那些。
怎么开始:四步
- 先测基线:跑一轮探测,看清哪些引擎提到了你、哪些没有,以及它们各自引用了谁;
- 按引擎选平台:优先选「多个引擎都在引」的站点,而不是单一引擎的自家生态;
- 按可引用性写稿:开头一句可直接摘走的定义,正文带数字、带出处、带原话,结构切块;
- 复盘归因:两周后再测一轮,比对提及率与引用来源的变化——只有公开引用的引擎能做到逐条归因。
常见疑问
问:不联网的模型还能被影响吗?
能,但走的是训练语料那条路,周期以模型迭代计。短期见效只能靠联网检索这条。
问:发得越多越好吗?
不是。我们的数据里,被 5 个引擎共同引用的站点只有少数几个,而大量站点只被 1 个引擎引过一次。铺量的边际收益衰减很快,选对平台比多发十篇更重要。
问:多久能看到变化?
联网检索这条通路最快次日就能出现引用变化,但要让提及率稳定上升通常需要数周的持续投放。
---
想看看现在各家 AI 都在引用谁来评价你的品类?注册领航鲸,免费探测一次就有答案。
延伸阅读:什么是 GEO、AI 引擎最爱引用哪些平台、怎样写出 AI 愿意引用的内容。
参考资料:Google《AI features and your website》官方文档、KDD 2024《GEO: Generative Engine Optimization》、OpenAI GPTBot 说明。