AI 说你排第几,有多少是真的:126 次重复观测
2 个品牌 × 3 个平台 × 3 个问题 × 2–4 种模式 × 3 轮重复,共 126 次独立观测。结论分两层且方向相反:在「谁被推荐、排第几」这一层,模式差异淹没在噪声里——同模式重跑三次的波动(2.74 位)比换模式(2.01 位)还大;在「AI 读了多少东西」这一层,差异是结构性的——12 组配对全部同向,深度模式读 47 个源、快速模式只读 12 个。附 42 格原始观测,可自行核对。
本文要点
- 2 个品牌 × 3 个平台 × 3 个问题 × 2–4 种模式 × 3 轮重复,共 126 次独立观测。
- 结论分两层且方向相反:在「谁被推荐、排第几」这一层,模式差异淹没在噪声里——同模式重跑三次的波动(2.74 位)比换模式(2.01 位)还大;
- 在「AI 读了多少东西」这一层,差异是结构性的——12 组配对全部同向,深度模式读 47 个源、快速模式只读 12 个。
八月底我们做了一件很笨的事:拿同一个问题,在同一个平台、同一个模式下,原地问了三遍。
问题是「2026年GEO监测平台哪个值得用?」,平台是 DeepSeek 深度思考模式。三次之间隔了不到一分钟,中间什么都没改。结果是这样的:
第一次排第 5,第二次没有提到我们,第三次排第 4。
如果只跑第一次和第三次,你会以为一切正常。只跑第二次,你会以为出事了。而如果第一次跑完你去发了几篇稿子,第三次再跑,你会以为是内容起效了。
三种解读,一种都不成立——因为什么都没发生。
我们本来想测的是另一件事
这轮实验最初的问题很具体:AI 的「深度思考」模式,会不会让品牌的推荐排名变好?
这个问题有现实意义。用户在豆包、DeepSeek、元宝里越来越常打开深度思考,而多数 GEO 监测工具只跑默认模式。如果两种模式给出的排名不一样,那所有人的数据都是偏的。
所以设计了一组对照:2 个品牌 × 3 个平台 × 3 个问题 × 2–4 种模式 × 3 轮重复 = 42 个观测单元 / 126 次独立观测。
两个品牌一个是成熟消费品类,一个是新兴 B2B 品类。消费品类那个是某国际运动品牌 2026 年上市的新款跑鞋(客户数据,下称「新品 A」)——这个时间点很重要:该产品线首款于 2026 年 3 月上市,最新型号 8 月初上市,实验采集时距最新型号上市不足一个月。B2B 品类那个是 GEO 监测平台,也就是我们自己所在的赛道。三个平台是 DeepSeek、通义千问、腾讯元宝。
关键的设计是最后那个「3 轮重复」。它当时看起来只是个稳妥做法,后来变成这轮实验唯一真正有价值的部分——因为它让我们能回答一个更前置的问题:在谈论任何差异之前,先搞清楚「什么都不改」的时候,数字本身会动多少。
什么都不改,62% 的内容会变
先看重复三轮之间的差异有多大。用 Jaccard 系数量一下推荐名单的重合度(两次推荐的品牌集合,交集除以并集),同一模式、不同轮次之间,均值 0.381。
翻译成人话:同一个问题原地问三遍,每两遍之间大约有 62% 的品牌是不一样的。
目标品牌的名次波动更直观:同一模式三轮之内,名次平均相差 2.74 位。然后把换模式的差异放在旁边——
|
波动来源 |
平均名次差 |
|---|---|
|
同一模式,原地重跑三次 |
2.74 位 |
|
换一种模式重跑 |
2.01 位 |
换模式的影响,比什么都不换还小。推荐名单的重合度也是同一个结论:不同模式之间的 Jaccard 是 0.351,同模式之间是 0.381,模式带来的额外不一致只有 3 个百分点。
到这里,最初那个问题就没法回答了。不是模式没有影响,是这个影响埋在噪声底下,用三轮重复根本捞不出来。
「深度思考模式下我们排第 2、快速模式下排第 5」——这类结论在统计上不成立。它和「同一个模式跑两次,一次第 2 一次第 5」是同一个现象。
但模式确实改变了一件事
排名这一层测不出来,另一层却干净得反常:引用源数量,也就是 AI 在生成这个回答之前实际读了多少个网页。
12 组配对,全部同向,一个例外都没有:
|
平台 · 问题 |
深度思考 |
快速模式 |
倍数 |
|---|---|---|---|
|
DeepSeek · 晨跑跑鞋推荐 |
47 |
12 |
3.9× |
|
DeepSeek · 城市漫步运动鞋 |
58 |
12 |
4.8× |
|
DeepSeek · 极简风运动鞋 |
42 |
12 |
3.5× |
|
DeepSeek · GEO监测平台哪个值得用 |
43 |
11 |
3.9× |
|
DeepSeek · 企业做GEO选哪个平台 |
50 |
11 |
4.5× |
|
DeepSeek · GEO效果怎么衡量 |
45 |
11 |
4.1× |
|
千问 · GEO监测平台哪个值得用 |
16 |
7 |
2.3× |
|
千问 · 企业做GEO选哪个平台 |
17 |
7 |
2.4× |
|
千问 · GEO效果怎么衡量 |
14 |
10 |
1.4× |
|
元宝 · GEO监测平台哪个值得用 |
22 |
17 |
1.3× |
|
元宝 · 企业做GEO选哪个平台 |
24 |
18 |
1.3× |
|
元宝 · GEO效果怎么衡量 |
23 |
18 |
1.3× |
排名那一层,12 组配对里有 5 组方向相反;引用源这一层,12 组全部同向。这个反差本身就是信号。
还有一个细节值得单独拎出来:DeepSeek 快速模式的引用源数量,在六个问题上全部落在 11 或 12。跑鞋三题都是 12,GEO 三题都是 11。这不是自然波动的样子,是一个固定的取材上限。
多读的那 35 个源,去哪了
深度模式读了 47 个源,快速模式只读 12 个,但目标品牌的名次基本没变。那多出来的 35 个源,影响了什么?
我们去看每种模式下独有的品牌——只在深度模式出现、快速模式没有的:
|
平台 · 问题 |
仅在深度思考模式下出现的品牌 |
|---|---|
|
DeepSeek · 高级感极简风运动鞋 |
Bottega Veneta、Prada、The Row、Givenchy、Veja、Lululemon、Puma、亚瑟士 |
|
DeepSeek · 适合城市漫步 |
Brooks、HOKA、New Balance、On、Vionic、亚瑟士 |
|
DeepSeek · GEO效果怎么衡量 |
11 个小众工具 |
全部是国际品牌、小众品牌、长尾工具。没有一个是那个品类里人尽皆知的头部。结论就清楚了:
榜单前几名由那 11–12 个高权重信源决定。多读的那 35 个源,只影响榜单尾巴。
这件事对不同位置的品牌,意义完全相反。如果你已经在核心信源池里,模式怎么切都不影响你——你在那 12 个源里,AI 读 12 个还是 47 个都会读到你。如果你还在池子外面,这就是生死线。深度模式能进榜、快速模式进不去,意味着你只存在于第 13 到第 47 个信源之间。
而这恰好给出一个比排名更早的诊断信号:
「深度模式能进、快速模式进不去」= 已经被 AI 发现了,但还没进核心信源池。
这个信号有实际用处。如果只盯排名,内容发出去之后的两到八周里你什么都看不到,然后某天突然跳变。而引用源构成的变化,能提前几周告诉你这个过程正在发生。
两件比模式大得多的事
第一件:平台差异是模式差异的 15 倍。
新品 A 在 DeepSeek 上 18 次观测被提及 17 次(94%),在通义千问上 18 次只被提及 1 次(6%)。两种模式都一样。
这不是模式问题,是整个平台的信源池里没有这个品牌。而结合上市时间看,这个结果是合理的:一个 2026 年 3 月才上市、最新型号 8 月初才上市的新品,尚未进入千问的信源池是正常状态,与其说是可见度差,不如说正是上一节讲的「已被发现但未进核心池」。
为什么偏偏是千问?我们2026 年 7 月的信源结构分析里有一个可能的解释:千问的专业媒体占比 33%,是五大引擎里最高的——它是最权威化的引擎,而新品最缺的正是专业媒体背书。
同一份分析里还有一条与此互补的数据:豆包的视频引用占比 34%,且全部来自抖音;文心 12%(62% 来自哔哩哔哩);而 DeepSeek 0.4%、元宝 0.1%、千问 0.5%,基本不引视频。抖音内容供给在消费/生活品类充足,在 B2B/工业品类稀缺——所以同一个消费品牌,在豆包和在千问面对的是两套完全不同的信源生态。这解释了为什么「在哪个平台」比「用哪种模式」重要一个数量级。
第二件:在新兴品类里,名次这个指标本身就没有意义。
|
品类 |
平均品牌池 |
全模式稳定共有 |
|---|---|---|
|
跑鞋(成熟消费品类) |
14.7 个 |
44% |
|
GEO 监测平台(新兴 B2B) |
28.6 个 |
24% |
最极端的一格:元宝上问「GEO 优化效果好不好怎么衡量」,跨所有模式一共出现了 54 个品牌,而所有模式都稳定出现的只有 5 个——9%。
在一个候选池 54、稳定核心只有 5 的品类里,AI 每次回答都在重新抽签。此时「我们这次排第 3」不是一个可复现的事实,名次的周环比变化几乎全是噪声,追求「排名提升」等于在优化一个随机变量。正确的目标应该换成:挤进那 5 个稳定共有的核心集合。
那你该怎么看手上那份排名报告
如果你正在买 GEO 监测服务,或者已经在看某个平台给的排名曲线,这轮数据给出三个可以直接问出口的问题。
第一,这个数字跑了几次?我们测出来,要把平均名次估到 ±1 位的置信区间,不同平台需要的观测次数是:
|
平台 · 品牌 |
名次标准差 |
需要多少次 |
|---|---|---|
|
DeepSeek · 本方品牌 |
0.9 |
4 |
|
千问 · 本方品牌 |
1.7 |
12 |
|
DeepSeek · 新品 A |
1.8 |
13 |
|
元宝 · 本方品牌 |
2.7 |
29 |
三轮远远不够。我们自己这份数据就是三轮,所以本文里任何单个格子的数字都不能当定论——只有跨格聚合之后的那几条结论才立得住。如果对方给你看的是单次采集的结果,那个数字不能用来判断任何事情。
第二,你们的噪声地板是多少?任何「排名提升了」「提及率下降了」的结论,都必须先有一条基线:同样的条件重跑,本来会波动多少。低于这条线的变化不该报给客户。我们这份数据的地板是 Jaccard 0.38、名次 ±2.74 位。你的行业、你的问题、你的平台,这个数会不一样,但必须有人测过。
第三,除了名次,你们还给我看什么?如果一份报告里只有排名曲线,它测的那个东西在短周期内主要由随机性驱动。真正稳定、灵敏、且能干预的是引用源——AI 到底读了哪些网页,这些网页里有没有你。
这三个问题的完整版本,以及另外两个可以当面验伪的问题,见《GEO优化公司与服务商怎么选:五个当面就能验伪的问题》。
这份数据自己的毛病
按这类对比该有的样子,把我们自己的问题也列出来。
三轮重复不够。上面那张表已经说明了——元宝那一组需要 29 次观测才能把名次估准,我们只跑了 3 次。所有单格结论都不该当定论用。
模式命名不统一。采集时各平台的叫法直接照抄,结果出现了「快速模式深度思考」这种字面自相矛盾的标签,以及同一个模式在元宝上有「临时对话深度思考」和「临时对话思考」两个名字,导致自动聚合把它拆成了两组。下一轮要先建映射字典。
发现一个必须单独标记的异常。元宝在「临时对话普通」模式下,把 DeepSeek、Kimi、元宝、文心一言、通义千问这些大模型本身,当作「GEO 监测平台」推荐了出来。同类情况在元宝的其他模式里也出现过,推荐了「腾讯」「百度」。
这不是排名结果,是模型对问题的语义理解发生了漂移——答非所问。这类回答如果混进提及率与共现统计,会系统性污染指标:虚增品牌池规模、拉低共有率、制造出并不存在的「竞品」。上面那个 54 个品牌里只有 5 个稳定的极端数字,就有这个因素在里面。我们已经把它单独标记出来,但这说明入库阶段需要一条独立的「答非所问」检出规则。
通义千问 APP 端的引用源整列为空,所以引用源那部分的分析没有千问 APP 的数据。
最后
这轮实验没有回答最初那个问题。深度思考模式对排名有没有影响,我们仍然不知道——只知道用三轮重复测不出来。
但它回答了一个更前置、也更有用的问题:在你为排名的涨跌做任何解释之前,先知道这个数字自己会动多少。
行业里现在有大量「排名从第 5 升到第 2」的说法。这些说法可能是真的,但在给出噪声地板之前,它们和「什么都没做」是不可区分的。
42 个观测格的原始数据放在下面,数字都可以自己核对。
常见问题
AI 给的品牌排名准不准?
为什么每次问 AI,结果都不一样?
深度思考模式和快速模式,哪个测出来的排名更准?
排名变化多少,才算真的动了?
服务商说帮我把排名做上去了,怎么验证?
为什么同一个品牌在不同 AI 平台的差距这么大?
附:42 个观测格的原始记录
说明:排名是目标品牌在三轮中的名次,「·」表示该轮未被提及;轮间 J 是这一格三轮之间的平均 Jaccard 相似度;引用源为该模式下 AI 读取的网页数量。「新品 A」为某国际运动品牌 2026 年上市的新款跑鞋,客户数据已匿名。
|
# |
品牌 |
平台 |
问题 |
模式 |
排名(3轮) |
榜长 |
轮间J |
引用源 |
|---|---|---|---|---|---|---|---|---|
|
01 |
新品 A |
DeepSeek |
晨跑轻便舒适的跑鞋推荐 |
深度思考 |
1/1/5 |
6/11/8 |
0.27 |
47 |
|
02 |
新品 A |
DeepSeek |
晨跑轻便舒适的跑鞋推荐 |
快速模式 |
1/1/1 |
4/6/3 |
0.56 |
12 |
|
03 |
新品 A |
DeepSeek |
适合城市漫步的舒适运动鞋 |
深度思考 |
1/1/1 |
7/9/5 |
0.38 |
58 |
|
04 |
新品 A |
DeepSeek |
适合城市漫步的舒适运动鞋 |
快速模式 |
1/1/1 |
5/4/5 |
0.58 |
12 |
|
05 |
新品 A |
DeepSeek |
高级感极简风运动鞋有哪些 |
深度思考 |
5/·/6 |
10/10/10 |
0.29 |
42 |
|
06 |
新品 A |
DeepSeek |
高级感极简风运动鞋有哪些 |
快速模式 |
5/1/2 |
10/9/7 |
0.37 |
12 |
|
07 |
新品 A |
千问APP |
高级感极简风运动鞋有哪些 |
思考模式 |
·/·/1 |
5/5/6 |
0.08 |
— |
|
08 |
新品 A |
千问APP |
高级感极简风运动鞋有哪些 |
普通模式 |
·/·/· |
4/5/4 |
0.26 |
— |
|
09 |
新品 A |
千问APP |
适合城市漫步的舒适运动鞋 |
思考模式 |
·/·/· |
4/4/4 |
0.13 |
— |
|
10 |
新品 A |
千问APP |
适合城市漫步的舒适运动鞋 |
普通模式 |
·/·/· |
5/5/4 |
0.17 |
— |
|
11 |
新品 A |
千问APP |
晨跑轻便舒适的跑鞋推荐 |
思考模式 |
·/·/· |
4/4/4 |
0.42 |
— |
|
12 |
新品 A |
千问APP |
晨跑轻便舒适的跑鞋推荐 |
普通模式 |
·/·/· |
5/4/4 |
0.46 |
— |
|
13 |
本方品牌 |
DeepSeek |
2026年GEO监测平台哪个值得用 |
深度思考 |
2/2/2 |
7/10/10 |
0.59 |
43 |
|
14 |
本方品牌 |
DeepSeek |
2026年GEO监测平台哪个值得用 |
普通 |
3/3/2 |
6/6/6 |
0.46 |
11 |
|
15 |
本方品牌 |
DeepSeek |
企业做GEO优化选哪个平台好 |
深度思考 |
3/3/· |
10/5/8 |
0.28 |
50 |
|
16 |
本方品牌 |
DeepSeek |
企业做GEO优化选哪个平台好 |
普通 |
2/3/3 |
5/4/6 |
0.77 |
11 |
|
17 |
本方品牌 |
DeepSeek |
GEO优化效果怎么衡量 |
深度思考 |
5/·/4 |
8/9/9 |
0.43 |
45 |
|
18 |
本方品牌 |
DeepSeek |
GEO优化效果怎么衡量 |
普通 |
·/·/· |
5/4/5 |
0.40 |
11 |
|
19 |
本方品牌 |
千问 |
2026年GEO监测平台哪个值得用 |
思考研究 |
3/1/4 |
10/10/10 |
0.47 |
16 |
|
20 |
本方品牌 |
千问 |
2026年GEO监测平台哪个值得用 |
快速模式 |
3/5/4 |
6/7/8 |
0.50 |
7 |
|
21 |
本方品牌 |
千问 |
2026年GEO监测平台哪个值得用 |
临时·思考 |
1/4/5 |
8/10/9 |
0.39 |
19 |
|
22 |
本方品牌 |
千问 |
2026年GEO监测平台哪个值得用 |
临时·快速 |
1/4/6 |
4/6/9 |
0.47 |
7 |
|
23 |
本方品牌 |
千问 |
企业做GEO优化选哪个平台好 |
思考研究 |
1/4/1 |
7/9/10 |
0.46 |
17 |
|
24 |
本方品牌 |
千问 |
企业做GEO优化选哪个平台好 |
快速模式 |
2/·/· |
5/6/4 |
0.58 |
7 |
|
25 |
本方品牌 |
千问 |
企业做GEO优化选哪个平台好 |
临时·思考 |
3/1/6 |
10/8/10 |
0.40 |
18 |
|
26 |
本方品牌 |
千问 |
企业做GEO优化选哪个平台好 |
临时·快速 |
1/·/· |
4/5/5 |
0.40 |
7 |
|
27 |
本方品牌 |
千问 |
GEO优化效果怎么衡量 |
思考研究 |
1/3/1 |
5/10/9 |
0.34 |
14 |
|
28 |
本方品牌 |
千问 |
GEO优化效果怎么衡量 |
快速模式 |
2/5/4 |
5/5/8 |
0.39 |
10 |
|
29 |
本方品牌 |
千问 |
GEO优化效果怎么衡量 |
临时·思考 |
6/5/2 |
10/9/10 |
0.29 |
20 |
|
30 |
本方品牌 |
千问 |
GEO优化效果怎么衡量 |
临时·快速 |
1/4/4 |
9/7/7 |
0.36 |
9 |
|
31 |
本方品牌 |
元宝 |
2026年GEO监测平台哪个值得用 |
普通 |
1/3/1 |
10/10/10 |
0.37 |
17 |
|
32 |
本方品牌 |
元宝 |
2026年GEO监测平台哪个值得用 |
深度思考 |
1/1/3 |
10/10/9 |
0.50 |
22 |
|
33 |
本方品牌 |
元宝 |
2026年GEO监测平台哪个值得用 |
临时·普通 |
9/4/1 |
10/10/10 |
0.34 |
18 |
|
34 |
本方品牌 |
元宝 |
2026年GEO监测平台哪个值得用 |
临时·思考 |
2/1/1 |
9/7/10 |
0.63 |
20 |
|
35 |
本方品牌 |
元宝 |
企业做GEO优化选哪个平台好 |
普通 |
1/1/1 |
10/10/10 |
0.48 |
18 |
|
36 |
本方品牌 |
元宝 |
企业做GEO优化选哪个平台好 |
深度思考 |
1/1/1 |
4/9/10 |
0.24 |
24 |
|
37 |
本方品牌 |
元宝 |
企业做GEO优化选哪个平台好 |
临时·普通 |
1/1/1 |
10/10/10 |
0.23 |
19 |
|
38 |
本方品牌 |
元宝 |
企业做GEO优化选哪个平台好 |
临时·思考 |
1/2/1 |
10/10/10 |
0.34 |
25 |
|
39 |
本方品牌 |
元宝 |
GEO优化效果怎么衡量 |
普通 |
·/·/· |
10/10/10 |
0.19 |
18 |
|
40 |
本方品牌 |
元宝 |
GEO优化效果怎么衡量 |
深度思考 |
7/1/1 |
10/10/10 |
0.12 |
23 |
|
41 |
本方品牌 |
元宝 |
GEO优化效果怎么衡量 |
临时·普通 |
·/·/· |
10/10/10 |
0.12 |
13 |
|
42 |
本方品牌 |
元宝 |
GEO优化效果怎么衡量 |
临时·思考 |
8/9/8 |
10/10/10 |
0.51 |
22 |
口径说明:品牌名做了归一化,以品牌而非型号为单元,共约 50 条映射规则。计算名次波动时,未被提及按第 11 位处理(榜单最长为 10)。Jaccard 基于归一化后的品牌集合。「深度/思考/研究」归为思考档,其余归为快速档,「临时」作为独立的会话因子。数据采集于 2026 年 8 月底,全部来自网页端与 APP 端的真实账号提问,非 API 调用。
基于中立监测底座的 GEO 研究与实践,持续提供可核验、可执行的行业内容。