指标测量·7 分钟读完·透镜GEO 实验室

第三方验收也会失效:四种请了也白请的情况

独立性只解决了「谁来测」,没解决「测什么、怎么测」。本文拆解第三方验收失效的四种情况:第三方由执行方介绍、仍只做单次采样、问题集由执行方给、口径没对齐。附处置。

本文要点

  • 独立性只解决了「谁来测」,没解决「测什么、怎么测」。
  • 本文拆解第三方验收失效的四种情况:第三方由执行方介绍、仍只做单次采样、问题集由执行方给、口径没对齐。
  • 附处置。

关于「GEO 效果要找第三方验收」这件事,该说的基本都说过了:截图不能复现、执行方不能自己给自己打分、单次采样不算数。

这篇不重复那些。它讲的是下一步的问题——请了第三方,然后呢。

我们见过不少这样的项目:流程齐全,第三方报告也出了,双方签了字。半年后回头看,那次验收什么也没验出来

不是第三方不专业,是独立性只解决了「谁来测」,没解决「测什么、怎么测、测完算谁的」。 下面四种情况,每一种都能让一次形式完整的第三方验收变成走过场。


失效一:第三方是执行方介绍来的

这是最常见、也最难开口的一种。

流程通常是这样:你提出要找第三方验收,服务商很配合,说「我们合作过几家,很专业,我帮你对接」。于是第三方来了,报告也出了,数据看起来没问题。

问题不在于这家第三方会不会作假——大概率不会,作假的风险对它来说不划算。

问题在于:它和谁的合作关系更长久。

一家长期给某服务商做验收的机构,和这家服务商之间存在持续的业务往来;而你是一次性的。这不需要任何人做坏事,只需要在有解释空间的地方——一个边界模糊的口径、一次要不要算作异常的判断——习惯性地往合作方那边偏一点点。

处置

```
□ 第三方由你直接选、直接付钱、直接交付报告
□ 报告的第一收件人是你,不是服务商
□ 在委托书里写明:第三方不得与被验方存在当期合作
□ 如果只能由服务商介绍,至少换一家,做交叉验证
```

一个判断标准:如果这家第三方不敢把「本机构与被验方无当期业务往来」写进报告,那这份报告的独立性就是口头的。


失效二:第三方也只做了一次采样

独立性和方法论是两件事。 换了一个人来拍照,拍的还是照片。

这一条的物理依据很硬:内容被 AI 引用之后活不了多久。

```
餐饮 5.3 天(全行业最长)
工业 3.9 天(全行业最短)
口径 每日采集,连续 2 天未被引判定结束
```

大部分行业落在 4~5 天。 也就是说,第三方在某一天测到的结果,本身就是一个短周期波动里的切片。

再叠加第二层:同一个问题问两次,AI 的答案本来就会不同——它会随对话上下文、账号历史、提问时段变化。

两层叠加的后果是:一次独立的采样,得到的是一个独立的、但仍然不可靠的数。

独立性提高了这个数的可信度(没人动手脚),但没有提高它的有效性(它代表不了这段时间的真实状态)。

处置

```
□ 报告必须写明:同一问题采样几次、几次之间差多少
□ 复测跨度至少覆盖两个续航周期(按 4~5 天算,即两周以上)
□ 要求给区间,不要点值 ——「提及率 X%」不如「X%~Y%,n 次采样」
□ 没有离散度的数字,只能当作参考,不能当作验收结论
```


想知道你的品牌是否被 AI 推荐?查看品牌 AI 可见性

失效三:问题集是执行方提供的

这是四种里最隐蔽的一种,因为它每一步看起来都合规。

第三方独立地、严谨地、可复现地测了一批问题——而这批问题是被优化过的那一方挑的。

问题集的选择空间有多大?我们用 1047 条真实 query 做过一次分区实测,按问题里是否含品牌名分区,测「跑偏率」(AI 回答偏离提问原意的比例):

```
空白区(不含任何品牌名) 跑偏率 13.3%
含品牌名的三个区 跑偏率 5.4% ~ 6.6%
```

差了两倍多。 而这只是「含不含品牌名」这一个维度带来的差异。再加上品类词的宽窄、场景的具体程度、竞品的强弱,同一个品牌可以配出结果差异极大的两套问题集,每一套都「真实」。

这不必然是恶意的。 执行方最熟悉自己做过什么,提供问题集时很自然会倾向于自己下过功夫的那些方向——这是人之常情,不是舞弊。但结果是一样的:你验收的是「他做过的那部分」,不是「你的生意需要的那部分」。

处置

```
□ 问题集由你和第三方定,执行方可以提建议但没有最终决定权
□ 保留一组「盲题」:执行方事先不知道、但对生意重要的问题
★ 这一组的结果往往比主问题集更说明问题
□ 问题集在项目开始时冻结,中途不得增删
—— 中途换题是最容易被忽略的一种失真
□ 空白泛词控制在 5 条以内(跑偏率 13.3%,噪声大)
```


失效四:口径没有事先对齐

前三条是流程问题,这一条是技术问题,也是最后才爆发的一条。

第三方出了报告,执行方说「我们自己测的数不是这样」。双方各拿一份数据,谁也说服不了谁。最后往往以「取个中间值」或「下次再说」收场——验收变成了扯皮。

根源几乎总是同一个:「被提到」这件事没有定义。

```
情况 算什么 分歧程度
品牌名出现在正文,没有链接 提及 小
品牌名出现,带了指向官网的链接 引用 小
引用了第三方文章,那篇文章里提到了品牌 间接引用 ★ 最大
只出现在「参考资料」列表里,正文没提 参考位 ★ 很大
回答推荐了品类,没点名任何品牌 空白结果 容易被漏记
```

把这几种揉成一个「曝光量」,两边算出来的数必然不同——因为大家在算不同的东西。

处置:在项目开始前,把计数口径写成文档,双方签字:

```
提及 —— 正文里出现了品牌名
引用 —— 回答带了可点击来源,且来源可归属到某个站点或账号
参考位 —— 只在来源列表里出现

三者分开计数,不合并。★ 合并是一切扯皮的起点。
```

为什么必须分开:这三者对应的动作完全不同。提及多而引用少,说明内容进了模型的记忆但没进当次检索的信源池;引用多而提及少,说明来源被采信但品牌名没被说出来。合成一个数,这个信息就没了。


五、这四条,对准我们自己

写到这里必须把话挑明:我们就是做第三方监测的。上面四条,我们同样可能犯。

所以这一节不是免责声明,是把这份清单交给你,用来验我们:

```
失效一 · 独立性
□ 我们是不是由你直接选、直接付钱、报告直接交给你?
□ 我们敢不敢写明与被验方无当期业务往来?
★ 如果我们同时在给你的服务商做业务,你有权要求我们回避。

失效二 · 方法论
□ 我们给的每个数,有没有写采样次数和离散度?
□ 复测跨度有没有覆盖两个续航周期?
★ 我们给出的任何一个点值,你都可以要求换成区间。

失效三 · 问题集
□ 问题集是谁定的?有没有留盲题?中途有没有增删?
★ 如果问题集是你的服务商给我们的,这份报告的说服力要打折,
我们应该主动告诉你这一点。

失效四 · 口径
□ 我们的「提及 / 引用 / 参考位」定义写在报告里了吗?
□ 和你现有的其他数据源对得上吗?
★ 对不上的时候,先比口径,不要先比结论。
```

我们卖这项服务,所以我们有动机把验收说得越必要越好。 读者有理由对这篇文章保持警惕。

我们能做的不是自证中立,而是把判据放在外面——上面这张表你可以直接拿来问我们,也可以拿去问任何一家同行。一份复现不出来的报告,不管出自谁手,都不能用来验收,包括我们的。


六、一次有效的第三方验收,最小配置

把四条倒过来,就是最小可行方案:

```
开始前
□ 第三方由甲方直接委托,报告直发甲方
□ 问题集由甲方与第三方共定,含一组盲题,项目期内冻结
□ 提及 / 引用 / 参考位三分口径写成文档,双方签字

执行中
□ 同题多次采样,报区间不报点值
□ 跨度至少两周(覆盖两个 4~5 天的续航周期)
□ 账号、入口、时段三项固定并记录

交付时
□ 原始回答全文随报告交付,不只交结论
□ 引用源逐条可点
□ 盲题结果单独列,与主问题集对照

★ 最后一条:验收不是终点,把复测周期写进合同。
按 3.9~5.3 天的续航算,一次性验收只能证明那一周。
```


附:数据出处

  • 内容被引续航天数:2026 年 8 月五引擎信源观测,追踪 DeepSeek、文心、豆包、
    元宝、千问的网页端与移动端共 8 个入口,覆盖 22 个行业、2100 多个品牌,按占比口径。
    续航口径:每日采集、连续 2 天未被引判定结束。
  • 五区跑偏率 13.3% / 5.4%~6.6%:1047 条真实 query 分区实测。
  • 第二节「复测跨度覆盖两个续航周期」是按续航天数推算的建议,非实测值,正文已说明。
  • 第四节的三分口径是我们的口径主张,不是行业标准,正文已标明。

相关阅读

你的品牌,AI 看得见吗?立即检测品牌