指标测量·8 分钟读完·透镜GEO 实验室

AI 回答里没有「第几名」:第三方排名监测该看什么

AI 回答是生成的不是排序的,系统里没有「第几名」这个值——你数出的位置是对一段自然语言的事后编号。本文拆解四个让排名失真的来源,以及不看排名该看的四组替代指标。

本文要点

  • AI 回答是生成的不是排序的,系统里没有「第几名」这个值——你数出的位置是对一段自然语言的事后编号。
  • 本文拆解四个让排名失真的来源,以及不看排名该看的四组替代指标。

几乎所有 AI 搜索监测工具都会给你一个数字:你排第几。

这个数字好用——它像搜索引擎的排名,可以画成曲线,可以写进周报,老板一眼看得懂。

但它和搜索引擎排名不是一回事,差别大到会导致错误决策。

这篇文章讲三件事:AI 回答里为什么没有稳定的「第几名」、这个数字在什么条件下还能用、以及不看排名该看什么。


一、搜索引擎的排名是排出来的,AI 的答案是生成的

先把最根本的区别说清楚。

搜索引擎返回的是一个排序结果:十条链接,有先后,这个顺序在同一时刻对同一个查询是确定的。「第几名」是系统内部真实存在的一个值。

AI 回答不是。它先检索一批材料,再生成一段话。你在这段话里数出来的「我们出现在第二个」,是阅读者对一段自然语言的事后编号,不是系统里存在的排序字段。

这个区别的后果是具体的:

```
搜索引擎排名 系统内有这个值 → 可重复读取 → 波动来自排序算法变化
AI「排名」 系统内没有这个值 → 每次生成都重新组织 → 波动来自生成本身
```

所以「排名从第 2 掉到第 5」这句话,在 AI 场景里可能根本不描述任何真实变化。 它可能只是这次回答换了个说法、多提了一家、把并列改成了分点。


二、四个让「第几名」失真的来源

其一:同一个问题,两次检索到的材料不同

产品端每次提问都会重新检索。检索结果有波动,材料一变,答案的组织方式就变。

叠加上内容本身的时效:

```
内容被引续航 餐饮 5.3 天(最长) · 工业 3.9 天(最短)
口径:每日采集,连续 2 天未被引判定结束
```

大部分行业落在 4~5 天。也就是说,两次相隔一周的测量,中间可能整批信源都换过一轮了。

其二:问法一变,结果换一个量级

我们用 1047 条真实 query 做过分区实测,按问题里是否含品牌名分区,测「跑偏率」——AI 回答偏离提问原意的比例:

```
空白区(不含任何品牌名) 跑偏率 13.3%
含品牌名的三个区 跑偏率 5.4% ~ 6.6%
```

差了两倍多。 而工具报给你的那个「排名」,是在某一批特定问法上测出来的。换一批问法,这个数会变,而且没有哪一批更「正确」。

其三:入口不同,答案不同

同一个引擎的网页端和 APP 端,语料调用和答案结构不是一回事。我们 2026 年 8 月的五引擎信源观测按 8 个入口分别采集,不是为了凑数量,是因为合并之后数据就不可用了。

一个把网页端和 APP 端合并报「排名」的工具,报的是一个不存在的平均值。

其四:五个引擎的答案结构本来就不同

```
豆包 引用的视频内容里,34% 全部来自抖音
元宝 引用明显达人化,达人内容占比 70%
千问 相反,权威信源占比 33%
```

在这三家上,「第几名」的含义完全不同。 元宝的第二名可能来自一个达人的推荐语,千问的第二名可能来自商品详情页。把它们平均成一个「综合排名」,等于把三张不同科目的卷子加起来算总分。


想知道你的品牌是否被 AI 推荐?查看品牌 AI 可见性

三、那这个数字什么时候还能用

不是说排名完全没用。 它在两个条件同时成立时是有意义的:

```
条件一 固定问法、固定入口、固定账号
—— 只在「同一条件下的自身对比」里成立

条件二 多次采样,报区间不报点值
—— 单次的点值落在波动里,区间才有信息
```

满足这两条时,排名可以用来看趋势:同一批问题、同一个入口,连续四周的区间在往上还是往下。

不满足时,它只能用来看一次快照——而快照按 4~5 天的续航算,两周后就过期了。

一个简单的判断:如果工具报给你的排名没有附带「几次采样、区间多宽」,那它给的是点值,点值不能用来做趋势判断。


四、不看排名,该看什么

这是本文最实用的一节。下面四组指标,每一组都对应一个排名回答不了的问题。

第一组:提及 / 引用 / 参考位,三者分开

这是所有指标的地基。「被提到」这件事必须先定义,否则后面所有数字都没有可比性:

```
提及 正文里出现了品牌名
引用 回答带了可点击来源,且来源可归属到某个站点或账号
参考位 只在来源列表里出现,正文没提
```

必须三者分开计数,不合并。 因为它们对应的动作完全不同:

```
提及多、引用少 → 内容进了模型的记忆,但没进当次检索的信源池
引用多、提及少 → 来源被采信,但品牌名没被说出来(榜单类回答常见)
只有参考位 → 你在信源池里,但还没进答案正文
```

合成一个「曝光量」,这个信息就没了——而它恰恰是决定下一步做什么的那个信息。

第二组:引用源可归属

每一条「被引用」,要能落到一个具体的 URL 或可识别账号。

为什么重要:

```
自媒体 / 达人内容 五个引擎都占 40% ~ 70%
企业官网 多数消费行业只占 5% ~ 16%
★ B2B 工业软件是例外,占 20% ~ 30%
```

一个几百粉丝的账号提你一次,和一个行业媒体提你一次,在「提及 +1」这个口径下完全一样,实际价值差很远。没有逐条引用源,提及次数换算不成任何有意义的东西。

第三组:离散度

同一个问题问 N 次,N 次之间差多少。

这一组几乎没有工具主动给,但它决定了前两组数字能不能信。 离散度大的问题,任何单次结果都不能用来做趋势——测的是生成的随机性,不是可见性的变化。

```
N 次结果一致 这条问题可信,可以用来做趋势
N 次差异很大 路由/生成在漂,这条问题只能看不能用
N 次引用源几乎不重合 ★ 比排名漂移更严重:连信源池都换了
```

第四组:描述本身

被提到不等于被说好话。 这一组是最容易被整个行业忽略的:

AI 怎么描述你?参数说对了吗?和竞品并列时,给你的定语是什么?

我们的行业观测里,负面内容对判断的影响倍数在汽车行业是 2.2 倍、餐饮 1.6 倍。一条口径不一致、参数写错的内容被 AI 采信,损失比不被引用更大。

排名上升而描述恶化,是有可能同时发生的——只看排名的监测,看不见这件事。


五、一个可以直接用的替代指标组

把上面四组落成可交付的字段:

```
必须有
□ 提及率 / 引用率 / 参考位率 三项分开,各自带分母
□ 每项的采样次数 n 与区间(非点值)
□ 引用源逐条清单,可点开,可归属
□ 分引擎、分入口拆开,不合并
□ 原始回答全文留存

建议有
□ 同题 N 次之间的引用源重合度
□ 描述性标签(AI 给你的定语,正面/中性/负面)
□ 与上一周期的对比,且是「和基线比」不是「和上周比」

★ 如果还要保留一个「排名」字段:
必须写明 固定问法 + 固定入口 + 采样次数 + 区间,
并标注它只用于同条件自身对比,不用于跨引擎、跨问法比较。
```


六、这条结论对我们自己同样成立

必须说清楚:我们就是卖 AI 搜索排名监测的。这篇文章拆的是我们自己在卖的那个指标。

为什么还要写?因为一个撑不住追问的指标,迟早会在预算会议上被拆穿,而那时候损失的是双方的信任。

所以把结论对准自己:

```
□ 我们报的任何一个排名,你都可以要求附上采样次数与区间
□ 我们报的跨引擎数字,你都可以要求拆开看单引擎、单入口
□ 我们如果给了一个「综合可见度分数」,你有权要求看权重和原始项
★ 拆不开的分数只能当参考,不能当验收依据 —— 包括我们的

□ 我们的开放 API 目前只提供网页端数据,不含 APP 端。
这一条会影响上面第四组里「分入口拆开」的完整性,我们主动写出来。
```

我们卖这项服务,所以我们有动机把指标说得越复杂越好。 读者有理由警惕这篇文章。我们能做的是把判据放在外面——第五节那张字段表,你可以拿去验我们,也可以拿去验任何一家同行。


七、三个今天就能做的检验

不用买任何工具:

```
□ 1. 同一个问题,在同一个引擎、同一个入口,连问三遍
三遍里你的位置一样吗?引用的来源一样吗?
★ 如果三遍都不一样,那任何单次的「第几名」都不能用

□ 2. 同一个问题,换成不含品牌名的问法再问三遍
结果差多少?
★ 这就是跑偏率 13.3% 在你品类上的具体表现

□ 3. 同一个问题,网页端问一遍、APP 端问一遍
答案结构一样吗?引用的来源重合多少?
★ 不重合的部分,就是「合并报数」会抹掉的东西
```

做完这三个,你再看任何一份带「排名」的报告,都会先问一句:这是几次采样、什么问法、哪个入口。


附:数据出处

  • 内容被引续航天数、分引擎信源结构、8 个入口口径:2026 年 8 月五引擎信源观测,
    追踪 DeepSeek、文心、豆包、元宝、千问的网页端与移动端共 8 个入口,
    覆盖 22 个行业、2100 多个品牌,按占比口径。
    续航口径:每日采集、连续 2 天未被引判定结束。
  • 五区跑偏率 13.3% / 5.4%~6.6%:1047 条真实 query 分区实测。
  • 负面锚定 2.2 倍 / 1.6 倍:同一轮行业观测。
  • 第一节关于「搜索引擎排序 vs 生成式回答」的对比是机制层面的结构描述
    不涉及任何引擎的内部实现。
  • 第三节的两个使用条件是我们的口径主张,不是行业标准

相关阅读

你的品牌,AI 看得见吗?立即检测品牌