GEO 效果第三方检测:中立口径与数据留痕方法
同一句「品牌被 AI 提到了」,不同的人算出来能差几倍——提及、引用、参考位必须分成三个互不重叠的计数。本文给出口径定义、三项固定条件、一条记录该留的七个字段。
本文要点
- 同一句「品牌被 AI 提到了」,不同的人算出来能差几倍——提及、引用、参考位必须分成三个互不重叠的计数。
- 本文给出口径定义、三项固定条件、一条记录该留的七个字段。
前两篇讲了为什么要第三方验收、怎么挑第三方工具。这一篇讲更底层的一件事:
一次 GEO 效果检测,到底怎么定义才算数。
同样一句「品牌被 AI 提到了」,不同的人算出来的数可以差好几倍——不是有人算错,是大家在算不同的东西。口径不统一,两份报告就没有可比性;而验收的前提恰恰是可比。
一、先定义「一次被引用」
这是所有分歧的源头。同一个 AI 回答,下面这些情况算不算「被引用」,必须提前说死:
```
情况 常见处理 建议口径
品牌名出现在正文,但没有链接 算/不算 算「提及」,不算「引用」
品牌名出现,且带了指向官网的链接 都算 算「引用」,单独记
引用了第三方文章,那篇文章里提到了品牌 分歧最大 算「间接引用」,与直接引用分开统计
只出现在「参考资料」列表里,正文没提 分歧最大 单独记为「参考位」,不并入提及
回答里推荐了品类,没点名任何品牌 不算 记为「空白结果」,是重要信号
```
必须拆成三个互不重叠的计数,而不是揉成一个「曝光量」:
```
提及 —— 正文里出现了品牌名
引用 —— 回答带了可点击的来源,且来源可归属到某个站点或账号
参考位 —— 只在来源列表里出现
```
理由很实际:这三者对应的动作完全不同。提及多而引用少,说明内容进了模型的记忆但没进当次检索的信源池;引用多而提及少,说明来源被采信但品牌名没被说出来——后者在榜单类回答里很常见。
一份不区分这三者的报告,读不出下一步该做什么。
二、三项固定:同账号、同入口、同时段
AI 的回答会随对话上下文、账号历史、提问时段变化。这三项不固定,两次数据就不是同一个实验。
```
□ 同一个账号 换账号,AI 的历史上下文就变了
□ 同一个入口 ★ 网页端和 APP 端的答案不同,不要混在一张表里
□ 记录时间 同一天不同时段结果也会变,时间戳必须落在记录里
□ 每次新开对话 不要在有上下文的会话里追问,追问会污染下一条
```
第二条最容易破功。 五个国产引擎都同时有网页端和 APP 端,两端的语料调用和答案结构不是一回事。我们 2026 年 8 月的五引擎信源观测就是按 8 个入口分别采集的——不是为了凑数量,是因为合并之后数据就不可用了。
想知道你的品牌是否被 AI 推荐?查看品牌 AI 可见性 →
三、问题集:决定后面所有判断的有效性
问题选错,后面全白做。这一步的质量比任何工具都重要,而且它最不该自动化。
我们用 1047 条真实 query 做过一次分区实测,按问题里是否含品牌名、含谁的品牌名分成五个区,测「跑偏率」——AI 的回答偏离提问原意的比例:
```
空白区(问题里不含任何品牌名) 跑偏率 13.3%
有品牌名的三个区 跑偏率 5.4% ~ 6.6%
```
空白区的跑偏率是有品牌区的两倍多。 而新手最爱测的恰恰是空白区的泛词。
一份 30~50 条的问题集,建议这样配比:
```
品牌词 5~8 条 「XX品牌怎么样」—— 跑偏率最低,是你的基线锚点
品类词 15~20 条 「预算X、场景Y,推荐哪家」—— 真正的战场
竞品词 5~8 条 「A和B哪个好」—— 看你在对比语境里的位置
空白泛词 5 条以内 ★ 只留少量,跑偏率高、噪声大
```
用你客户的原话写问题,不要用关键词。 AI 对话里的提问是带背景、预算、场景的完整句子,不是搜索框里的短词组。这两者测出来的东西不一样。
四、留痕:一条记录要留哪几个字段
留痕的目的只有一个——让任何第三方能照着复现你的结论。按这个标准倒推,一条记录至少要有:
```
必留
① 提问原文 一字不改,包括标点
② 回答全文 不是摘要,是整段
③ 引擎 + 入口 例:豆包·APP端
④ 时间戳 精确到分钟
⑤ 引用源清单 每条可点开,落到 URL 或可识别账号
建议留
⑥ 本条是第几次采样 同一问题的第 N 次
⑦ 账号标识 不必是真实身份,一个稳定的代号即可
```
第 ②⑤ 两项是分水岭。 只留排名数字的记录,三个月后除了画一条曲线什么也干不了;留了全文和引用源,你随时能回头回答「那次掉名次到底发生了什么」。
一个可操作的自检:把任意一条记录交给一个完全不了解这个项目的人,他能不能照着复现一遍? 不能,就是字段缺了。
五、复测频率:由内容的续航天数决定
复测多久一次不是拍脑袋,它有一个物理下限——内容被 AI 引用后能活多久:
```
餐饮 5.3 天(全行业最长)
工业 3.9 天(全行业最短)
口径 每日采集,连续 2 天未被引判定结束
```
大部分行业落在 4~5 天,所以复测频率的下限大约是每周一次。
低于这个频率,两次采样之间内容可能已经进出引用池好几轮,你看到的不是趋势,是随机切片。
还有一层反直觉:工业这类「决策链长、节奏慢」的行业,续航反而最短(3.9 天),需要的复测频率比消费行业更高。 把行业节奏和内容时效当成一回事,是这里最常见的误判。
六、基线:先空转三周
这是最容易被砍掉、也最不该砍掉的一步。
```
第 1 周 跑完整问题集,留存全部原始记录 —— 这是基线
第 2~4 周 不做任何优化动作,只重复采样
目的:先量出「什么都不做时,数据本身波动多大」
第 5 周起 开始做内容,每次只改一个变量
每周复测,每次和基线比,不和上周比
```
「和基线比,不和上周比」——这条看着像细节,实际决定了结论的可信度。和上周比,你比的是两个都带波动的点;和基线比,你至少有一个多次采样得出的参照区间。
没有第 2~4 周的空转期,你之后拿到的任何「提升」,都无法和正常波动分开。
七、这套口径同样适用于我们
写到这里必须说清楚:上面每一条,我们自己出的报告也必须满足。
我们是做监测的,这套口径写得越严,看起来越像在给自己立门槛。但它真正的作用是反过来的——它让我们的报告也变得可以被你推翻。
```
本文所有数字都带口径与样本量:
续航 3.9~5.3 天 每日采集、连续 2 天未被引判定结束
跑偏率 13.3% 1047 条真实 query 分区实测
信源结构 8 个入口、22 个行业、2100 多个品牌,占比口径
你可以用同样的方法在自己的品类上跑一遍。
跑出来不一致,以你的数据为准。
```
一份复现不出来的报告,不管出自谁手,都不能用来验收。包括我们的。
附:数据出处
- 内容被引续航天数、分入口信源结构:2026 年 8 月五引擎信源观测,
追踪 DeepSeek、文心、豆包、元宝、千问的网页端与移动端共 8 个入口,
覆盖 22 个行业、2100 多个品牌,按占比口径。
续航口径:每日采集、连续 2 天未被引判定结束。 - 五区跑偏率 13.3% / 5.4%~6.6%:1047 条真实 query 分区实测。
- 第五节的复测频率下限是按续航天数推算的,非实测值,正文已说明。
- 第一节的「建议口径」是我们的口径主张,不是行业标准,正文已用「建议」标明。