← 返回文章列表
指标测量14 分钟读完透镜GEO 研究组

AI 说你排第几,有多少是真的:126 次重复观测

2 个品牌 × 3 个平台 × 3 个问题 × 2–4 种模式 × 3 轮重复,共 126 次独立观测。结论分两层且方向相反:在「谁被推荐、排第几」这一层,模式差异淹没在噪声里——同模式重跑三次的波动(2.74 位)比换模式(2.01 位)还大;在「AI 读了多少东西」这一层,差异是结构性的——12 组配对全部同向,深度模式读 47 个源、快速模式只读 12 个。附 42 格原始观测,可自行核对。

本文要点

  • 2 个品牌 × 3 个平台 × 3 个问题 × 2–4 种模式 × 3 轮重复,共 126 次独立观测。
  • 结论分两层且方向相反:在「谁被推荐、排第几」这一层,模式差异淹没在噪声里——同模式重跑三次的波动(2.74 位)比换模式(2.01 位)还大;
  • 在「AI 读了多少东西」这一层,差异是结构性的——12 组配对全部同向,深度模式读 47 个源、快速模式只读 12 个。

八月底我们做了一件很笨的事:拿同一个问题,在同一个平台、同一个模式下,原地问了三遍。

问题是「2026年GEO监测平台哪个值得用?」,平台是 DeepSeek 深度思考模式。三次之间隔了不到一分钟,中间什么都没改。结果是这样的:

第一次排第 5,第二次没有提到我们,第三次排第 4。

如果只跑第一次和第三次,你会以为一切正常。只跑第二次,你会以为出事了。而如果第一次跑完你去发了几篇稿子,第三次再跑,你会以为是内容起效了。

三种解读,一种都不成立——因为什么都没发生。


我们本来想测的是另一件事

这轮实验最初的问题很具体:AI 的「深度思考」模式,会不会让品牌的推荐排名变好?

这个问题有现实意义。用户在豆包、DeepSeek、元宝里越来越常打开深度思考,而多数 GEO 监测工具只跑默认模式。如果两种模式给出的排名不一样,那所有人的数据都是偏的。

所以设计了一组对照:2 个品牌 × 3 个平台 × 3 个问题 × 2–4 种模式 × 3 轮重复 = 42 个观测单元 / 126 次独立观测

两个品牌一个是成熟消费品类,一个是新兴 B2B 品类。消费品类那个是某国际运动品牌 2026 年上市的新款跑鞋(客户数据,下称「新品 A」)——这个时间点很重要:该产品线首款于 2026 年 3 月上市,最新型号 8 月初上市,实验采集时距最新型号上市不足一个月。B2B 品类那个是 GEO 监测平台,也就是我们自己所在的赛道。三个平台是 DeepSeek、通义千问、腾讯元宝。

关键的设计是最后那个「3 轮重复」。它当时看起来只是个稳妥做法,后来变成这轮实验唯一真正有价值的部分——因为它让我们能回答一个更前置的问题:在谈论任何差异之前,先搞清楚「什么都不改」的时候,数字本身会动多少。


什么都不改,62% 的内容会变

先看重复三轮之间的差异有多大。用 Jaccard 系数量一下推荐名单的重合度(两次推荐的品牌集合,交集除以并集),同一模式、不同轮次之间,均值 0.381

翻译成人话:同一个问题原地问三遍,每两遍之间大约有 62% 的品牌是不一样的。

目标品牌的名次波动更直观:同一模式三轮之内,名次平均相差 2.74 位。然后把换模式的差异放在旁边——

波动来源

平均名次差

同一模式,原地重跑三次

2.74 位

换一种模式重跑

2.01 位

换模式的影响,比什么都不换还小。推荐名单的重合度也是同一个结论:不同模式之间的 Jaccard 是 0.351,同模式之间是 0.381,模式带来的额外不一致只有 3 个百分点。

到这里,最初那个问题就没法回答了。不是模式没有影响,是这个影响埋在噪声底下,用三轮重复根本捞不出来。

「深度思考模式下我们排第 2、快速模式下排第 5」——这类结论在统计上不成立。它和「同一个模式跑两次,一次第 2 一次第 5」是同一个现象。


但模式确实改变了一件事

排名这一层测不出来,另一层却干净得反常:引用源数量,也就是 AI 在生成这个回答之前实际读了多少个网页。

12 组配对,全部同向,一个例外都没有:

平台 · 问题

深度思考

快速模式

倍数

DeepSeek · 晨跑跑鞋推荐

47

12

3.9×

DeepSeek · 城市漫步运动鞋

58

12

4.8×

DeepSeek · 极简风运动鞋

42

12

3.5×

DeepSeek · GEO监测平台哪个值得用

43

11

3.9×

DeepSeek · 企业做GEO选哪个平台

50

11

4.5×

DeepSeek · GEO效果怎么衡量

45

11

4.1×

千问 · GEO监测平台哪个值得用

16

7

2.3×

千问 · 企业做GEO选哪个平台

17

7

2.4×

千问 · GEO效果怎么衡量

14

10

1.4×

元宝 · GEO监测平台哪个值得用

22

17

1.3×

元宝 · 企业做GEO选哪个平台

24

18

1.3×

元宝 · GEO效果怎么衡量

23

18

1.3×

排名那一层,12 组配对里有 5 组方向相反;引用源这一层,12 组全部同向。这个反差本身就是信号。

还有一个细节值得单独拎出来:DeepSeek 快速模式的引用源数量,在六个问题上全部落在 11 或 12。跑鞋三题都是 12,GEO 三题都是 11。这不是自然波动的样子,是一个固定的取材上限。


多读的那 35 个源,去哪了

深度模式读了 47 个源,快速模式只读 12 个,但目标品牌的名次基本没变。那多出来的 35 个源,影响了什么?

我们去看每种模式下独有的品牌——只在深度模式出现、快速模式没有的:

平台 · 问题

仅在深度思考模式下出现的品牌

DeepSeek · 高级感极简风运动鞋

Bottega Veneta、Prada、The Row、Givenchy、Veja、Lululemon、Puma、亚瑟士

DeepSeek · 适合城市漫步

Brooks、HOKA、New Balance、On、Vionic、亚瑟士

DeepSeek · GEO效果怎么衡量

11 个小众工具

全部是国际品牌、小众品牌、长尾工具。没有一个是那个品类里人尽皆知的头部。结论就清楚了:

榜单前几名由那 11–12 个高权重信源决定。多读的那 35 个源,只影响榜单尾巴。

这件事对不同位置的品牌,意义完全相反。如果你已经在核心信源池里,模式怎么切都不影响你——你在那 12 个源里,AI 读 12 个还是 47 个都会读到你。如果你还在池子外面,这就是生死线。深度模式能进榜、快速模式进不去,意味着你只存在于第 13 到第 47 个信源之间。

而这恰好给出一个比排名更早的诊断信号:

「深度模式能进、快速模式进不去」= 已经被 AI 发现了,但还没进核心信源池。

这个信号有实际用处。如果只盯排名,内容发出去之后的两到八周里你什么都看不到,然后某天突然跳变。而引用源构成的变化,能提前几周告诉你这个过程正在发生。


两件比模式大得多的事

第一件:平台差异是模式差异的 15 倍。

新品 A 在 DeepSeek 上 18 次观测被提及 17 次(94%),在通义千问上 18 次只被提及 1 次(6%)。两种模式都一样。

这不是模式问题,是整个平台的信源池里没有这个品牌。而结合上市时间看,这个结果是合理的:一个 2026 年 3 月才上市、最新型号 8 月初才上市的新品,尚未进入千问的信源池是正常状态,与其说是可见度差,不如说正是上一节讲的「已被发现但未进核心池」。

为什么偏偏是千问?我们2026 年 7 月的信源结构分析里有一个可能的解释:千问的专业媒体占比 33%,是五大引擎里最高的——它是最权威化的引擎,而新品最缺的正是专业媒体背书。

同一份分析里还有一条与此互补的数据:豆包的视频引用占比 34%,且全部来自抖音;文心 12%(62% 来自哔哩哔哩);而 DeepSeek 0.4%、元宝 0.1%、千问 0.5%,基本不引视频。抖音内容供给在消费/生活品类充足,在 B2B/工业品类稀缺——所以同一个消费品牌,在豆包和在千问面对的是两套完全不同的信源生态。这解释了为什么「在哪个平台」比「用哪种模式」重要一个数量级。

第二件:在新兴品类里,名次这个指标本身就没有意义。

品类

平均品牌池

全模式稳定共有

跑鞋(成熟消费品类)

14.7 个

44%

GEO 监测平台(新兴 B2B)

28.6 个

24%

最极端的一格:元宝上问「GEO 优化效果好不好怎么衡量」,跨所有模式一共出现了 54 个品牌,而所有模式都稳定出现的只有 5 个——9%

在一个候选池 54、稳定核心只有 5 的品类里,AI 每次回答都在重新抽签。此时「我们这次排第 3」不是一个可复现的事实,名次的周环比变化几乎全是噪声,追求「排名提升」等于在优化一个随机变量。正确的目标应该换成:挤进那 5 个稳定共有的核心集合。


那你该怎么看手上那份排名报告

如果你正在买 GEO 监测服务,或者已经在看某个平台给的排名曲线,这轮数据给出三个可以直接问出口的问题。

第一,这个数字跑了几次?我们测出来,要把平均名次估到 ±1 位的置信区间,不同平台需要的观测次数是:

平台 · 品牌

名次标准差

需要多少次

DeepSeek · 本方品牌

0.9

4

千问 · 本方品牌

1.7

12

DeepSeek · 新品 A

1.8

13

元宝 · 本方品牌

2.7

29

三轮远远不够。我们自己这份数据就是三轮,所以本文里任何单个格子的数字都不能当定论——只有跨格聚合之后的那几条结论才立得住。如果对方给你看的是单次采集的结果,那个数字不能用来判断任何事情。

第二,你们的噪声地板是多少?任何「排名提升了」「提及率下降了」的结论,都必须先有一条基线:同样的条件重跑,本来会波动多少。低于这条线的变化不该报给客户。我们这份数据的地板是 Jaccard 0.38、名次 ±2.74 位。你的行业、你的问题、你的平台,这个数会不一样,但必须有人测过。

第三,除了名次,你们还给我看什么?如果一份报告里只有排名曲线,它测的那个东西在短周期内主要由随机性驱动。真正稳定、灵敏、且能干预的是引用源——AI 到底读了哪些网页,这些网页里有没有你。

这三个问题的完整版本,以及另外两个可以当面验伪的问题,见《GEO优化公司与服务商怎么选:五个当面就能验伪的问题》


这份数据自己的毛病

按这类对比该有的样子,把我们自己的问题也列出来。

三轮重复不够。上面那张表已经说明了——元宝那一组需要 29 次观测才能把名次估准,我们只跑了 3 次。所有单格结论都不该当定论用。

模式命名不统一。采集时各平台的叫法直接照抄,结果出现了「快速模式深度思考」这种字面自相矛盾的标签,以及同一个模式在元宝上有「临时对话深度思考」和「临时对话思考」两个名字,导致自动聚合把它拆成了两组。下一轮要先建映射字典。

发现一个必须单独标记的异常。元宝在「临时对话普通」模式下,把 DeepSeek、Kimi、元宝、文心一言、通义千问这些大模型本身,当作「GEO 监测平台」推荐了出来。同类情况在元宝的其他模式里也出现过,推荐了「腾讯」「百度」。

这不是排名结果,是模型对问题的语义理解发生了漂移——答非所问。这类回答如果混进提及率与共现统计,会系统性污染指标:虚增品牌池规模、拉低共有率、制造出并不存在的「竞品」。上面那个 54 个品牌里只有 5 个稳定的极端数字,就有这个因素在里面。我们已经把它单独标记出来,但这说明入库阶段需要一条独立的「答非所问」检出规则。

通义千问 APP 端的引用源整列为空,所以引用源那部分的分析没有千问 APP 的数据。


最后

这轮实验没有回答最初那个问题。深度思考模式对排名有没有影响,我们仍然不知道——只知道用三轮重复测不出来。

但它回答了一个更前置、也更有用的问题:在你为排名的涨跌做任何解释之前,先知道这个数字自己会动多少。

行业里现在有大量「排名从第 5 升到第 2」的说法。这些说法可能是真的,但在给出噪声地板之前,它们和「什么都没做」是不可区分的。

42 个观测格的原始数据放在下面,数字都可以自己核对。


常见问题

AI 给的品牌排名准不准?
短周期内不准,主要由随机性驱动。实测:同一个问题、同一个平台、同一个模式,原地重跑三次,目标品牌名次平均相差 2.74 位,推荐名单每两次之间约有 62% 的品牌不一样。要判断排名是否真的变了,必须先有噪声地板——同样条件重跑本来会波动多少。低于这条线的变化不能算作效果。
为什么每次问 AI,结果都不一样?
生成式引擎的回答有随机性,这是模型本身的特性,不是采集出错。我们的实测数据是:同模式三轮之间的推荐名单 Jaccard 均值 0.381,也就是每两次之间约 62% 的内容不同。判断趋势要看持续监测,不要用单次结果下判断。
深度思考模式和快速模式,哪个测出来的排名更准?
两个都不更准——这个问题本身问错了。实测:换模式带来的名次差异(2.01 位)比同一模式原地重跑的波动(2.74 位)还小,所以模式对排名的影响埋在噪声底下,测不出来。模式真正改变的是取材范围:DeepSeek 深度模式读 47 个源、快速模式只读 12 个,12 组配对全部同向。
排名变化多少,才算真的动了?
取决于你的平台和品类,必须自己测。我们这份数据的噪声地板是名次 ±2.74 位、Jaccard 0.38。另外要把平均名次估到 ±1 位的置信区间,不同平台需要 4 到 29 次观测——三轮远远不够。任何低于噪声地板的变化,都不该被解释成优化成果。
服务商说帮我把排名做上去了,怎么验证?
问三件事:同样的条件重跑过吗、重跑的波动是多少、原始回答留存了吗。如果对方给的是单次采集的结果,那个数字不能用来判断任何事情。另外可以追问「深度思考和快速模式你测的是哪个」——答不上来说明采集是单一模式跑的,那份数据回答不了「我们在不在核心信源池里」。
为什么同一个品牌在不同 AI 平台的差距这么大?
因为各引擎的信源生态不同,而且差异远大于模式差异。实测同一品牌在 DeepSeek 提及率 94%、在通义千问只有 6%,相差 15 倍。原因之一是信源结构:千问的专业媒体占比 33%(五引擎最高),而豆包的视频引用占比 34% 且全部来自抖音。同一份内容在两个平台面对的是两套完全不同的取材偏好。

附:42 个观测格的原始记录

说明:排名是目标品牌在三轮中的名次,「·」表示该轮未被提及;轮间 J 是这一格三轮之间的平均 Jaccard 相似度;引用源为该模式下 AI 读取的网页数量。「新品 A」为某国际运动品牌 2026 年上市的新款跑鞋,客户数据已匿名。

#

品牌

平台

问题

模式

排名(3轮)

榜长

轮间J

引用源

01

新品 A

DeepSeek

晨跑轻便舒适的跑鞋推荐

深度思考

1/1/5

6/11/8

0.27

47

02

新品 A

DeepSeek

晨跑轻便舒适的跑鞋推荐

快速模式

1/1/1

4/6/3

0.56

12

03

新品 A

DeepSeek

适合城市漫步的舒适运动鞋

深度思考

1/1/1

7/9/5

0.38

58

04

新品 A

DeepSeek

适合城市漫步的舒适运动鞋

快速模式

1/1/1

5/4/5

0.58

12

05

新品 A

DeepSeek

高级感极简风运动鞋有哪些

深度思考

5/·/6

10/10/10

0.29

42

06

新品 A

DeepSeek

高级感极简风运动鞋有哪些

快速模式

5/1/2

10/9/7

0.37

12

07

新品 A

千问APP

高级感极简风运动鞋有哪些

思考模式

·/·/1

5/5/6

0.08

08

新品 A

千问APP

高级感极简风运动鞋有哪些

普通模式

·/·/·

4/5/4

0.26

09

新品 A

千问APP

适合城市漫步的舒适运动鞋

思考模式

·/·/·

4/4/4

0.13

10

新品 A

千问APP

适合城市漫步的舒适运动鞋

普通模式

·/·/·

5/5/4

0.17

11

新品 A

千问APP

晨跑轻便舒适的跑鞋推荐

思考模式

·/·/·

4/4/4

0.42

12

新品 A

千问APP

晨跑轻便舒适的跑鞋推荐

普通模式

·/·/·

5/4/4

0.46

13

本方品牌

DeepSeek

2026年GEO监测平台哪个值得用

深度思考

2/2/2

7/10/10

0.59

43

14

本方品牌

DeepSeek

2026年GEO监测平台哪个值得用

普通

3/3/2

6/6/6

0.46

11

15

本方品牌

DeepSeek

企业做GEO优化选哪个平台好

深度思考

3/3/·

10/5/8

0.28

50

16

本方品牌

DeepSeek

企业做GEO优化选哪个平台好

普通

2/3/3

5/4/6

0.77

11

17

本方品牌

DeepSeek

GEO优化效果怎么衡量

深度思考

5/·/4

8/9/9

0.43

45

18

本方品牌

DeepSeek

GEO优化效果怎么衡量

普通

·/·/·

5/4/5

0.40

11

19

本方品牌

千问

2026年GEO监测平台哪个值得用

思考研究

3/1/4

10/10/10

0.47

16

20

本方品牌

千问

2026年GEO监测平台哪个值得用

快速模式

3/5/4

6/7/8

0.50

7

21

本方品牌

千问

2026年GEO监测平台哪个值得用

临时·思考

1/4/5

8/10/9

0.39

19

22

本方品牌

千问

2026年GEO监测平台哪个值得用

临时·快速

1/4/6

4/6/9

0.47

7

23

本方品牌

千问

企业做GEO优化选哪个平台好

思考研究

1/4/1

7/9/10

0.46

17

24

本方品牌

千问

企业做GEO优化选哪个平台好

快速模式

2/·/·

5/6/4

0.58

7

25

本方品牌

千问

企业做GEO优化选哪个平台好

临时·思考

3/1/6

10/8/10

0.40

18

26

本方品牌

千问

企业做GEO优化选哪个平台好

临时·快速

1/·/·

4/5/5

0.40

7

27

本方品牌

千问

GEO优化效果怎么衡量

思考研究

1/3/1

5/10/9

0.34

14

28

本方品牌

千问

GEO优化效果怎么衡量

快速模式

2/5/4

5/5/8

0.39

10

29

本方品牌

千问

GEO优化效果怎么衡量

临时·思考

6/5/2

10/9/10

0.29

20

30

本方品牌

千问

GEO优化效果怎么衡量

临时·快速

1/4/4

9/7/7

0.36

9

31

本方品牌

元宝

2026年GEO监测平台哪个值得用

普通

1/3/1

10/10/10

0.37

17

32

本方品牌

元宝

2026年GEO监测平台哪个值得用

深度思考

1/1/3

10/10/9

0.50

22

33

本方品牌

元宝

2026年GEO监测平台哪个值得用

临时·普通

9/4/1

10/10/10

0.34

18

34

本方品牌

元宝

2026年GEO监测平台哪个值得用

临时·思考

2/1/1

9/7/10

0.63

20

35

本方品牌

元宝

企业做GEO优化选哪个平台好

普通

1/1/1

10/10/10

0.48

18

36

本方品牌

元宝

企业做GEO优化选哪个平台好

深度思考

1/1/1

4/9/10

0.24

24

37

本方品牌

元宝

企业做GEO优化选哪个平台好

临时·普通

1/1/1

10/10/10

0.23

19

38

本方品牌

元宝

企业做GEO优化选哪个平台好

临时·思考

1/2/1

10/10/10

0.34

25

39

本方品牌

元宝

GEO优化效果怎么衡量

普通

·/·/·

10/10/10

0.19

18

40

本方品牌

元宝

GEO优化效果怎么衡量

深度思考

7/1/1

10/10/10

0.12

23

41

本方品牌

元宝

GEO优化效果怎么衡量

临时·普通

·/·/·

10/10/10

0.12

13

42

本方品牌

元宝

GEO优化效果怎么衡量

临时·思考

8/9/8

10/10/10

0.51

22

口径说明:品牌名做了归一化,以品牌而非型号为单元,共约 50 条映射规则。计算名次波动时,未被提及按第 11 位处理(榜单最长为 10)。Jaccard 基于归一化后的品牌集合。「深度/思考/研究」归为思考档,其余归为快速档,「临时」作为独立的会话因子。数据采集于 2026 年 8 月底,全部来自网页端与 APP 端的真实账号提问,非 API 调用。

透镜GEO 研究组

基于中立监测底座的 GEO 研究与实践,持续提供可核验、可执行的行业内容。

相关阅读

文章 · 入门指南Agent驱动追溯AI 回答链路:一种深入分析生成式引擎如何回答用户提问的方法文章 · 指标测量GEO工具与服务商怎么选:四类生意的定价与能力边界对照资讯 · 企业资讯AI大模型给出答案时究竟怎么给内容打分?内容可信度信号全拆解资讯 · 平台观察AI 搜索答案里的品牌歧视:全球品牌 73%,小众品牌仅 11%资讯 · 平台观察爆红的GEO,市场规模到底有多大?是风口还是骗局?文章 · 入门指南GEO是什么意思:先分清美瞳、卫星轨道和生成式引擎优化文章 · 指标测量GEO效果监测 2026:别只看排名,看这四个数据才能验收文章 · 指标测量GEO优化多少钱?2026报价:差别不在数字,在敢不敢复现文章 · 指标测量GEO排名监测2026:排名和实际引用对不上的原因

浏览全部深度文章 →浏览全部企业资讯 →