GEO效果怎么验收:客户翻来覆去只问这三个问题2026
GEO效果要能支撑续费,必须盯着三件事验收:被提到、引用了谁、有没有点击,并要求服务商提供可复现的分平台分问题数据。四份调查显示,做GEO的人80%–96%,能度量的人只有6%–23%;State of AEO Report 2026中40.6%把缺少度量与归因工具列为最大挑战。读者能拿到现成验收表:提及率需按五大引擎分平台报告、把问题分优势区/竞争区/敌占区/歧义区/空白区;引用来源需逐条核验URL并区分官网、专业媒体、自媒体达人,实测自媒体在所有引擎占40%–70%,通义千问专业媒体占33%,分行业官网被引占比从汽车5%到科技软件25%;点击归因需用UTM、短链、品牌词搜索量变化三层追踪,ChatGPT引荐流量仅约0.2%,但L
本文要点
- GEO效果要能支撑续费,必须盯着三件事验收:被提到、引用了谁、有没有点击,并要求服务商提供可复现的分平台分问题数据。
- 四份调查显示,做GEO的人80%–96%,能度量的人只有6%–23%;
- State of AEO Report 2026中40.6%把缺少度量与归因工具列为最大挑战。
为什么你拿到的GEO报告答不上来'这笔钱花得值不值'
现在大多数 GEO 报告只能告诉你'大概方向',不能支撑续费决策。这不是因为服务商不努力,而是因为报告里缺了三个问题的答案:被提到、引用了谁、有没有点击。这三个问题分别对应“有没有被看见”“被看见的质量”“看见后有没有用”,而大多数报告只回答了第一个,且第一个答案本身还不可复现。
对决策层来说,这笔钱买到了什么?如果报告答不上来'被提到/引用了谁/有没有点击',就不能续费。被提到(提及率)只是起点,IAB 4P 里第一个 P;引用了谁(引用来源)决定这次提及是正面还是负面、是权威还是垃圾;有没有点击(转化)决定商业结果。但很多报告只给一个提及率数字,而且这个数字可能是某一次查询的截图,换个时间就变了。所以决策层要问:这个提及率是怎么测出来的?再测一遍还是这个数吗?原始回答留了吗?如果答不上来,就不能续费。四份独立调查(样本从27到599)都指向同一个缺口:做的人80-96%,能度量的人6-23%。State of AEO Report 2026 里,40.6% 的受访者把“缺少度量与归因工具”列为最大挑战,位列第一。这意味着,你拿到的报告大概率也是方向性的,不是决策级的。
对执行团队来说,要求服务商提供能复现的数据,而不是截图。截图是某一次查询的结果,但 AI 回答是概率性的,换个时间、换个账号可能不同。所以必须要求服务商提供原始回答留存、查询记录、采样方法,这样才能复现。这里有一个简单的验证动作:问服务商要一次原始回答截图或全文,要不出来说明这个数没法验。验收不是数发了多少篇稿,是同一批问题的答案变没变,存了原文才能吵得清。
对数据团队来说,检查数据是否可复现:同一批问题再问一遍,结果是否一致。具体怎么检查?需要看采样规则、查询量、提问类型覆盖、测试频率、可复现性、数据校验、方法学文档、平台覆盖。IAB《Measuring Visibility in the AI Era》把这八件事列为决策级数据的标准,并直言:失败在于把方向性数据当成决策级数据来用,却没意识到中间的差距。你可以问服务商一句:“这个数是怎么测出来的、再测一遍还是这个数吗、原始回答留了吗?”如果对方答不上来,这份报告就只能看个大概方向,不能拿去定预算。
方向性数据和决策级数据的差距,可以用一张表说清:
|
维度 |
方向性数据 |
决策级数据 |
|---|---|---|
|
样本量 |
小,几十条查询 |
大,覆盖品类与子品类 |
|
查询量 |
少,单次测试 |
多,持续监测 |
|
提问类型覆盖 |
单一,只测品牌词 |
覆盖定义题、对比题、推荐题等 |
|
测试频率 |
一次性 |
日级或周级复测 |
|
可复现性 |
不可复现,截图为准 |
可复现,原始回答留存 |
|
数据校验 |
无 |
有书面校验方法 |
|
方法学文档 |
无 |
有完整方法学说明 |
|
平台覆盖 |
单一平台 |
分平台单独报告 |
人工能做到哪一步?你可以要求服务商提供原始回答,但人工无法验证服务商是否真的按同一批问题复测了,也无法自己大规模复测。透镜GEO 的“数据采集(detect)机制”通过真实用户行为模拟,每日自动模拟真实用户提问,抓取AI生成答案,并留存原始问答快照,支持一键导出,这样你就能自己验证复现性,而不是依赖服务商提供的截图。同时“品牌诊断(analyze)机制”记录每一次查询过程,全量监测日志与原始问答记录留存,可提供查询快照,支持一键导出存档。
提及率怎么验:一个总数没有意义,必须分平台分问题看
提及率是必要的起点,但必须分平台、分问题类型报告,不能只给一个总数。一个总数会掩盖两个关键差异:不同引擎的信源结构不同,不同问题类型天然产生提及的概率不同。
对决策层:提及率回答“我们有没有出现在对话里”,但一个总数没有意义,要分平台看。你手上如果只有“提及率 45%”这一个数字,它既不能告诉你哪个平台在说你、哪个平台没说你,也不能告诉你这 45% 里有多少是准确的、有多少是把你归错品类。IAB 的 4P 框架里,提及率(Presence)只是第一个 P,它回答的是“有没有被提到”,但连它自己都要求分平台单独报告——因为不同引擎读的东西不一样。不同引擎读的东西不一样,这就是信源结构。你可以自己验证:打开豆包和 DeepSeek 问同一个问题,看回答末尾列出的引用来源,数一下有几条指向你自己的官网。我们实测过五个引擎的信源结构:自媒体达人在所有引擎都是第一大信源,占 40%–70%,腾讯元宝最高达 70%;通义千问的专业媒体占 33%,是五引擎里最高的。这意味着同一个品牌在豆包里的提及率可能来自自媒体内容,在通义千问里可能来自专业媒体,两个平台的提及率数字背后是完全不同的内容来源。所以,验收时第一件事就是要求服务商把每个平台的提及率单独列出来,而不是合并成一个总数。
对执行团队:要求服务商提供分平台、分问题类型的提及率,并附上原始回答。分问题类型为什么重要?因为不同问题类型天然产生提及的概率不同。把你关心的每个问题按“AI 回答它的时候说了谁”分成五种:优势区(AI 点了你的名,还排在前面)、竞争区(AI 点了你,但竞品排在你前头)、敌占区(AI 只点竞品,不提你)、歧义区(AI 点了你,但说错了)、空白区(AI 谁也不点)。你可以自己验证:挑 20 个问题逐个问,记下出现品牌名了吗、出现的是谁。没分区之前,你的提及率分母里混着一批天然产不出提及的问题,这部分预算注定归零。下面这张清单可以直接拿去对服务商的报告逐项打勾。
|
检查项 |
要求 |
为什么 |
|---|---|---|
|
分平台报告 |
每个引擎单独列出提及率,不能合并成一个总数 |
不同引擎信源结构差异大(A1 实测),同一个品牌在不同引擎的提及率可能完全不同 |
|
分问题类型报告 |
按五区分别统计提及率 |
不同问题类型天然产生提及的概率不同,空白区跑偏率更高(A6 实测),一个总数会掩盖问题 |
|
原始回答留存 |
提供每次提问的原始回答截图或全文 |
没有原始回答,提及率无法验证,也无法检查“提到”是否准确 |
|
样本量与查询量 |
披露总共测了多少条 query,每个平台多少条 |
样本量太少,提及率没有统计意义 |
|
复测一致性 |
同一批问题隔一段时间再测,结果是否一致 |
AI 回答有随机性,单次结果不能作为验收依据 |
对数据团队:自己抽样 20 个问题,用豆包或 DeepSeek 逐个问一遍,数几个回答里出现了你的品牌名,再对比服务商报告。具体做法:挑 20 个你最在意的问题,打开豆包或 DeepSeek,逐个问,只记两件事——出现品牌名了吗?出现的是谁?半小时能做完,不用买任何工具。这一步做完,你就能发现服务商报告里的提及率和你自己测出来的差多少。如果差距超过 10 个百分点,就要问清楚对方的采样口径是什么。
引用来源怎么验:被提到不等于被引用,引用来源决定提及能不能复现
被提到不等于被引用,引用来源决定这次提及能不能复现、有没有说服力。AI 回答里出现你的品牌名,可能只是模型从训练数据里“知道”你,但回答末尾没有引用来源,或者引用来源是第三方。这种提及是脆弱的——模型更新、算法调整,它就可能消失。而如果引用来源是你的官网或你主动发布的内容,你就能通过维护这些内容来影响 AI 的引用,提及才可复现。
对决策层来说,引用来源是资产,不是曝光。如果 AI 提到你但引用的是第三方,那这次提及可能随时消失;引用来源才是资产。你花钱买到的“提及”,如果引用来源不可控,等于租来的曝光,不是资产。只有引用来源指向你拥有的内容,你才拥有这个位置。这决定了预算该投向哪里:是投在不可控的第三方,还是投在你能控制的内容上。
对执行团队来说,要求服务商逐条列出每次提及对应的引用来源,并标注是官网、媒体还是自媒体。执行团队要做的第一件事,是让服务商把“提及率”拆开:每一次提及,AI 引用了哪个 URL?这个 URL 是你的官网、你投放的媒体稿、还是自媒体达人写的?如果服务商给不出逐条引用来源,那这个提及率就是黑盒,无法验收。执行团队需要拿到一张表:每个问题、每次提及、对应的引用来源 URL、来源类型、是否可追溯、是否主动发布。
对数据团队来说,检查引用来源是否真实可访问,是否是你主动发布的内容,还是别人写的。数据团队在核验时,要打开每个引用来源 URL,确认它真实存在、内容与 AI 回答一致、且发布时间合理。还要判断这个来源是不是你主动发布的:如果是你官网或你付费投放的媒体,那是主动发布;如果是第三方自发写的,那是被动获得。主动发布的来源你可以控制,被动来源你只能影响。数据团队还需要记录引用来源的稳定性:隔一段时间再测,看引用来源是否变化。
很多团队只看提及率,却不知道 AI 是从哪里读来的这些信息。这就是信源结构——AI 给出这些说法时,是从哪些地方读来的:品牌官网、专业媒体、自媒体达人、平台聚合页,各占多少。你可以自己验证:看 AI 回答末尾列出的引用来源,数一下有几条指向你自己的官网。如果官网占比很低,说明你的内容预算可能投错了通道。
我们对五大引擎的抽样统计(A1)显示:自媒体达人是所有引擎的第一大信源,占 40%–70%,腾讯元宝最高达 70%;通义千问的专业媒体占 33% 为五引擎最高。这意味着,如果你的提及大部分来自自媒体达人,而这些达人内容你无法控制,那么你的提及就不稳定。分行业看(A2),官网被引占比在不同行业差异很大:科技软件 25%、企业服务 21%、教育 16%、文旅 7%、快消 6%、汽车 5%。如果你的行业官网占比很低,说明 AI 更倾向于引用第三方,你更需要关注引用来源的可控性。体裁上(A3),榜单、教程、评测是被引主力,纯资讯和单一案例占比极低。这意味着你主动发布的内容要符合这些体裁,才更可能被引用。
IAB 的 Decision-Grade 标准要求可复现性和数据校验,而引用来源正是可复现性的基础。如果引用来源不稳定,这次提及就无法复现,数据就是方向性的。所以验收引用来源,就是把提及率从方向性数据提升到决策级数据的关键一步。
人工可以手动抽查几个问题的引用来源,但面对几百个问题、多个平台、每日更新,人工无法持续追踪每个引用来源的变化和真实性。这时需要工具接手:引用来源追溯分析机制可以深度追溯引用来源,明确品牌内容被哪些高权重媒体、官网收录后被 AI 抓取,合规采集、全程留痕并提供查询快照。这样数据团队就能拿到可核验的引用来源清单,而不是服务商口头说的“我们被引用了”。
下面是一张引用来源验收表,执行团队可以拿它去要求服务商逐条填写:
|
来源类型 |
占比(已知数据点) |
是否可追溯 |
是否主动发布 |
|---|---|---|---|
|
官网 |
科技软件 25%、企业服务 21%、教育 16%、文旅 7%、快消 6%、汽车 5%(A2) |
是,URL 可访问 |
是 |
|
专业媒体 |
通义千问专业媒体占 33%,为五引擎最高(A1) |
是,但需确认是否付费投放 |
视投放情况 |
|
自媒体达人 |
五引擎总体 40%–70%,腾讯元宝最高 70%(A1) |
是,但内容不可控 |
否(除非合作) |
|
平台聚合页 |
未单独统计,但常见 |
是 |
否 |
数据来源:A1 为 2026 年 7 月对豆包/DeepSeek/文心一言/通义千问/腾讯元宝的被引来源抽样统计;A2 为分行业官网被引占比实测。占比因行业和引擎而异,表中列出的是已知数据点,不是固定值。
点击归因怎么验:AI 搜索的点击在传统后台是空白,必须专门追踪
AI 搜索的点击在传统分析后台是空白,必须用专门的归因方法才能看到。用户在豆包、DeepSeek 里问了你、看完 AI 对你的描述、直接做了判断——这整个过程在你的网站分析后台是空白的,没有 referrer、没有会话。SparkToro 2026 年的研究给出了一个量级参照:ChatGPT 仅贡献约 0.2% 的引荐流量。不是 AI 搜索没人在用,是传统归因链路在 AI 搜索这里断了。
对决策层来说,没有点击数据,就无法算 ROI,这笔预算就永远说不清。你可以在会上讲"我们被 AI 提到了 47 次",但 CFO 问的是"这 47 次带来了多少钱"。答不上来,明年预算就悬了。Webflow 的案例提供了一个反直觉的参照:LLM 流量转化率是 Google 的 6 倍。这意味着 AI 搜索带来的流量虽然少,但质量极高——用户带着明确意图来,AI 已经替他筛过一轮。这笔流量值得专门追踪,不是因为它量大,是因为它转化好,而且现在几乎没人能拿出这个数。
对执行团队来说,点击归因要分两层做。第一层是"有链接的点击":要求服务商在 AI 回答中出现的链接加 UTM 参数,或者用短链追踪。第二层是"没有链接的提及":用户在 AI 回答里看到你的品牌名,没有点任何链接,直接去搜索引擎搜你的品牌名,或者直接访问官网。这类行为在传统后台里被归为直接流量或自然搜索,源头丢了。追踪第二层的办法是看品牌词搜索量的变化——AI 提及上升后,品牌词搜索量有没有同步上升。这个相关性就是"被看到"的间接证据。
对数据团队来说,技术实现上有三个关键点。第一,UTM 参数要打在 AI 回答里出现的链接上,但注意 AI 平台可能不展示链接,或者展示的是聚合页链接而非你的原始链接。第二,短链追踪可以绕过部分平台的链接改写,但短链本身可能被 AI 平台判定为低信任度来源。第三,品牌词搜索量变化要排除其他营销活动的干扰——同期有没有投广告、有没有做线下活动,这些都会污染数据。干净的做法是:选一个没有其他营销动作的窗口期,只跑 AI 侧的内容,看品牌词搜索量的变化。
|
方法 |
优点 |
局限 |
|---|---|---|
|
UTM 参数 |
直接归因到具体内容,数据干净 |
AI 平台可能不展示链接,或改写链接 |
|
短链追踪 |
绕过部分链接改写,可统计点击 |
短链可能被判定为低信任度来源 |
|
品牌词搜索量变化 |
捕捉"被看到但没点击"的行为 |
需排除其他营销活动干扰,只能做相关性判断 |
|
落地页追踪 |
可统计 AI 流量到站后的行为路径 |
依赖链接被展示,且需区分 AI 流量与其他来源 |
点击归因的验收标准不是"有没有点击数据",是"点击数据能不能复现、能不能追溯到具体内容"。问服务商三个问题:这个点击是从哪个 AI 平台来的、用户点的是哪条内容、这条内容是什么时候发布的。答不上来,说明这个数没法验。
被怎么描述比提及率更重要:出现不等于有利
出现不等于有利。AI 提到你时的描述可能正在劝退客户——这是甲方付了钱最委屈的地方。提及率只回答“有没有被提到”,回答不了“被提到时说了什么”。而后者才是决定一个正在选型的人更想找你、还是更不想找你的关键。IAB 4P 框架里,提及率只是第一个 P(Presence),第二个 P 是 Portrayal——被怎么描述。多数服务商按提及率收费,等于只对四个维度里的第一个负责,剩下三个没人管。
对决策层来说,你花钱买到了一次提及,但这次提及可能是负面的。如果 AI 说“一家规模较小的创业公司”“功能相对基础”,或者干脆把你归到错的品类、把竞品的短板安在你头上,这次提及就是在劝退客户。决策层要问的不是“我们被提到了几次”,而是“被提到的那几次,有多少次是在帮我们说话”。IAB 在 Portrayal 维度下明确列了四个子项:情感倾向(Sentiment)、语境框架(Framing)、幻觉率(Hallucination Rate)、事实错误率(Factual Inaccuracy Rate)。这四个子项,没有一个能靠“提及次数”回答。
对执行团队来说,要求服务商提供情感倾向和事实准确性报告,而不只是提及次数。具体验收时,把 AI 提到你的段落完整读一遍,问自己一句:这段话会让一个正在选型的人更想找你,还是更不想?然后按三个维度检查:正面/中性/负面、事实错误、影响。下面这张表可以直接用作验收清单。
|
检查项 |
正面/中性/负面 |
事实错误 |
影响 |
|---|---|---|---|
|
AI 对品牌规模的定性描述(如“创业公司”“规模较小”) |
负面 |
可能无 |
劝退看重稳定性的 B 端客户 |
|
AI 对品牌品类的归类(如把 SaaS 归到“工具类”而非“平台类”) |
负面 |
有 |
直接误导选型 |
|
AI 对品牌功能的描述(如把竞品的短板安在你头上) |
负面 |
有 |
损害信任,难以纠正 |
|
AI 对品牌行业地位的描述(如“二线品牌”“非头部”) |
中性/负面 |
可能无 |
影响决策权重 |
对数据团队来说,读 AI 提到你的完整段落,判断是正面、中性还是负面,并检查有没有事实错误。采样规则:固定一批问题,分引擎、分时段采集,留存原始回答全文。判断情感倾向时,不要只看有没有“推荐”“不建议”这类词,要看整段话的语境——比如“适合预算有限的小团队”在 B 端采购场景里可能是负面的。事实错误要单独标记:AI 是否把你的产品功能安到竞品头上、是否把过时的参数当成现状、是否把你的品牌归到错误的品类。A6 实测显示,在品牌不出现的区域,AI 跑偏率更高——歧义区 9.0%,空白区 13.3%。这意味着越是你没占住的问题,AI 越可能说错你。所以数据团队在验收时,要特别关注那些“品牌名出现了但描述可疑”的样本,而不是只看提及率达标。
人工能做到哪一步:人工可以读几十段回答,判断情感和事实错误,但面对几百个问题、五个引擎、双端、日级更新时,人工读不过来,而且判断标准会漂移。工具从哪里接手:透镜GEO 的品牌口碑监测(detect)用 NLP 识别 AI 问答中正、中、负情感倾向,输出情感健康度评分;品牌情感分析(analyze)实时捕捉情感倾向,一旦发现负面苗头及时预警并溯源;大模型幻觉巡检(detect)检测 AI 是否把技术参数、收益率等事实张冠李戴。先用工具做检测,再由 Agent 做分析与决策——比如自动区分是内容缺失、信源不足还是竞品压制导致的负面描述,而不是只报一个“负面提及数”。
提及率是对的,也是 IAB 4P 的第一个 P,但它只覆盖了四个维度里的第一个。本节补的是第二个 P——被怎么描述。验收时如果只盯着提及率,等于只检查了“有没有被看见”,却不管“被看见时穿的是什么衣服”。
验收不是看一次截图,而是同一批问题反复问
验收的本质是看答案变没变,不是看某一次截图里你排第几。AI 生成有随机性,单次结果可能是运气,也可能是平台当天的临时波动。只有同一批问题反复问、把每次回答都留档,才能区分"真的被 AI 采纳了"和"恰好那次被提到了"。如果答案不稳定,说明优化没有沉淀进 AI 的信源结构里,钱白花了。
对决策层来说,这件事直接决定续费判断。你不需要看几十页报告,只需要问服务商一个问题:同一批问题,上周和这周的回答一样吗? 如果答案每次都在变,说明你的品牌信息没有被 AI 稳定采信,只是偶尔被捞到。IAB《Measuring Visibility in the AI Era》把"可复现性"列为决策级数据的八项标准之一——不能复现的结果,连方向性数据都算不上,更不能拿去开会定预算。反过来,如果同一批问题的回答在连续复测中保持稳定,且引用来源指向你的官网或你投放的内容,这才说明优化真正沉淀下来了。
对执行团队来说,复测要写进服务商合同里,而不是验收时临时提。约定三件事:复测频率(建议每周一次,关键品类可以加密到每日)、固定问题集(验收期间不许换题,换题等于重新开始)、原始回答全文留存(截图不够,要能导出完整文本和引用来源列表)。这三条缺一条,验收就没有证据链。服务商如果只给你"提及率从 30% 涨到 45%"这种汇总数字,却不给原始回答,这个数没法验——你无法判断涨的是不是同一批问题、引用的是不是你的内容、回答里对你的描述是正面还是劝退。
对数据团队来说,复测的判定规则要提前定死,否则每次复测都会吵"这算不算被引"。一个可操作的判定口径是:固定问题集,每天同一时段问一次,分引擎记录;以 URL 或其内容片段出现在回答的引用来源中判定为被引;连续 2 天未被引判定为本次内容引用结束。 这个口径来自我们自己的内容续航天数监测——按这个规则实测,餐饮类内容在 AI 引用中的平均存活时间是 5.3 天,工业类是 3.9 天。这意味着什么?意味着如果你每周才复测一次,餐饮类内容可能已经死了一轮你都不知道;工业类内容更短,一周内可能已经换了两轮信源。复测频率必须高于内容的平均续航天数,否则你看到的永远是滞后画面。
复测记录表不需要复杂,六列就够:
|
日期 |
问题 |
引擎 |
是否提到 |
引用来源 |
变化 |
|---|---|---|---|---|---|
|
08-01 |
家用咖啡机推荐 |
豆包 |
是 |
知乎评测文 |
— |
|
08-03 |
家用咖啡机推荐 |
豆包 |
是 |
知乎评测文 |
无变化 |
|
08-05 |
家用咖啡机推荐 |
豆包 |
否 |
— |
引用消失 |
|
08-05 |
家用咖啡机推荐 |
DeepSeek |
是 |
品牌官网 |
首次出现 |
这张表的价值不在"是否提到"那一列,在"变化"那一列。变化列里出现"引用消失""引用源从官网变成第三方""描述从正面变成中性",这些才是验收时真正要讨论的东西。一次截图只能证明"那一刻被提到了",这张表才能证明"被提到这件事能不能持续、靠什么持续"。
人工能做到哪一步:手动复测 20 个问题、每天问一次、记录六列,工作量大约半小时到一小时,执行团队自己做一周没问题。但问题集超过 50 个、引擎超过 3 个、频率要求每日、还要留存原始回答全文时,人工就会撞墙——不是做不了,是坚持不了两周。漏记一天,整个连续判定就断了。工具从这里接手:品牌排名监测按固定问题集每日自动提问并留存原始回答快照,内容续航天数监测按"连续 2 天未被引判定结束"的规则自动计算每条内容的存活状态。人工负责定问题集和看变化列,机器负责每天问、每天记、每天判。
验收不是一个人的事:先明确这件事在你们公司归谁
验收不是一个人的事,需要明确 owner 和产出物。如果没人 owner,验收就是走过场。
对决策层来说,这件事在你们公司归谁?如果没人 owner,验收就是走过场。这不是危言耸听:State of AEO 2026 调查显示 32.5% 的企业没有单一负责人,WFA 对 27 个品牌(合计 310 亿美元广告支出)的调查里 43% 归属跨多个团队共担,国内 2026 Q1 新增 GEO 预算约 70% 来自品牌公关部。三个独立来源指向同一个事实——GEO 验收在多数企业里没有明确的负责人。决策层要做的第一件事不是看报告,而是先定 owner。没有 owner,报告再漂亮也落不到决策上。
对执行团队来说,指定一个负责人,每周出一份验收报告,包含三件事的数据。这三件事前面几节已经讲过:被提到、引用了谁、描述是否有利。负责人不需要自己跑数据,但要确保每周有人把这三件事的数据汇总成一张表,并且能回答“这个数是怎么测出来的”。因为国内预算大头在品牌公关部,负责人往往要同时协调品牌、市场、IT 三个部门——品牌部关心描述是否有利,市场部关心提及率,IT 部关心数据采集是否合规。负责人每周的产出物就是一张验收周报,频率固定,内容固定,谁都能看懂。
对数据团队来说,技术团队负责搭建数据采集和验证流程。数据团队要保证的不是“出一次报告”,而是“同一批问题反复问,答案变没变”这件事能被持续执行。具体包括:固定提问集、分平台采集、留存原始回答快照、记录采集时间与账号环境。这些是决策级数据的最低要求,缺了任何一项,验收报告就退回到“只能看个大概方向”的水平。
|
角色 |
职责 |
产出物 |
频率 |
|---|---|---|---|
|
决策层(CMO/VP) |
批准预算、确定验收标准、听取汇报 |
验收结论与续费决策 |
每月一次 |
|
执行负责人(市场经理) |
指定 owner、汇总三件事数据、协调跨部门 |
验收周报 |
每周一次 |
|
数据团队(优化师/数据分析) |
搭建采集与验证流程、留存原始回答 |
原始回答快照、采集日志 |
每日/每周 |
这张表的作用不是把责任推给某个人,而是让验收这件事从“谁都能管、谁都不管”变成“谁负责什么、产出什么、多久一次”。没有这张表,验收就是走过场。
截图可以造假,但原始数据和复测结果很难造假
截图是结果,不是证据。结果可以被挑、被改、被断章取义,而原始数据是过程——过程要伪造,成本高得多,而且一复测就露。这就是为什么验收的最后一关不是看报告,是看数据本身。
对决策层来说,这一节只需要记住一句话:如果服务商拒绝提供原始数据,就要警惕。
这不是技术问题,是态度问题。一个真正做了监测的服务商,原始数据是现成的——查询记录、回答全文、引用来源,这些在系统里躺着,导出就是。拒绝提供只有一个解释:他不想让你看到数据是怎么来的。IAB《Measuring Visibility in the AI Era》把「数据校验」列为决策级数据的八项标准之一,原话是买方应把缺少书面校验方法视为厂商质量主张的实质性缺口。翻译过来就是:拿不出原始数据的报告,连「方向性数据」都算不上,只能算「装饰性数据」。
决策层不需要自己去看数据,但需要在续费会议上问一句:「这份报告里的每一个数,能不能追溯到原始回答?」答不上来的,预算讨论到此为止。
对执行团队来说,要的东西很具体:三样,一样都不能少。
第一样是查询快照。每一次监测提问,系统应该留存完整的查询记录——什么时候问的、问的什么、在哪个平台问的、用的是哪个账号环境。快照的作用是证明「这次提问真的发生过」,而不是事后拼出来的。A9 的站点实测抓取数据说明了一件事:真实爬虫的行为和人类访问完全不同,Googlebot 的非内容请求占 76.6%,Bytespider 高达 93.2%。同样的道理,真实的监测查询和伪造的查询记录,在时间戳、请求序列、响应结构上都有痕迹。快照就是这些痕迹的载体。
第二样是原始回答全文。不是摘要,不是截取的关键段落,是 AI 从第一个字到最后一个字的完整输出。为什么必须全文?因为「被提到」和「被怎么提到」是两件事,而后者只有全文能看出来。一个品牌名出现在回答的第 3 段和第 15 段,语境完全不同;一段被截掉的负面描述,在摘要里可能显示为「中性提及」。IAB 的 Portrayal 维度——被怎么描述——只能基于全文判断,基于摘要判断等于没判断。
第三样是引用来源 URL。AI 回答末尾列出的每一条引用,都要能点到具体的页面。这一条同时验证两件事:一是这次提及有没有信源支撑,二是支撑它的信源是不是你花钱铺的那些。如果服务商说「引用来源不稳定,有时候显示有时候不显示」,那就要求他把「显示的时候」的 URL 全部留存。留不下来,说明他根本没在记录这一层。
三样东西的频率也要定:不是验收那天才要,是每周或每月固定导出。数据是连续的,不是点状的。只给验收当天数据的服务商,和只给考试当天成绩单的学生一样,你无法判断他平时在干什么。
对数据团队来说,这一关的核心动作是复测:自己用干净环境再问一遍,对比结果。
干净环境的定义很具体:无历史对话、无个性化推荐、无地理位置干扰。用一个新的账号、或者至少清空对话历史的账号,在同一个平台、用同一批问题、在相近的时间段提问。如果服务商报告里说「豆包回答中品牌排名第 2」,你自己复测出来是第 5,不一定是服务商造假——AI 回答本身有随机性,单次差异在合理范围内。但如果复测 10 次,8 次都不在服务商报告的位置上,那就是数据有问题。
复测的第二个作用是识别「挑好截图」。AI 回答有随机性,同一个问题问 10 次,可能 3 次提到你、7 次没提到。服务商如果只给你看那 3 次的截图,报告上写「提及率 100%」,这在技术上不算造假——那 3 次确实发生了——但它是系统性偏差。复测能暴露这个偏差:你自己问 10 次,发现只有 3 次提到你,你就知道那个 100% 是怎么来的了。
这里有一个方法论上的参照,来自 A10 记录的 Meta Project Cannes 事件。那个项目被曝光为丑闻,但它的方法设计里有一条对品牌方极有参考价值:几百名承包商不走 API,在产品前端手动提问,逐条留存原始回答,而不是只记「拒答率」这类汇总结论。为什么前端手动提问比 API 调用更接近真实?因为 API 是接近裸模型的调用,没有产品前端注入的系统提示、没有账号记忆与历史、没有产品级安全策略——它给不出「真实用户会看到什么」的答案。这正是复测必须用干净环境、走产品前端的原因。同时必须说清红线:Meta 的问题不在方法,在于伪造了未成年身份、向对手平台灌入假样本。复测可以模拟用户「可能是」的身份,绝不能伪造用户「不可能是」的身份。我们自己的复测必须控频率、用干净环境,这是底线。
复测的第三个作用是验证「数据有没有被静默处理」。IAB 标准里有一条明确要求:幻觉与事实错误的识别方法必须书面说明,且必须向客户报告被标记的提及,而不是静默剔除。什么意思?如果服务商在监测中发现 AI 把你描述错了——比如把竞品的短板安在你头上——他不能悄悄把这条从报告里删掉,只留下「正面提及」。他必须告诉你:这条提及存在,但内容是错的,我们标记了它。数据团队复测时如果发现报告里没有的负面或错误提及,而服务商从未报告过,那就是静默剔除,是比数据不准更严重的问题。
最后是伪造数据的识别。这一层最难,但有一个基本判断:看数据之间的逻辑是否自洽。提及率、引用来源、排名位置、情感倾向,这四个维度之间有内在关联。一个品牌在某个平台的提及率突然从 10% 跳到 40%,但引用来源没有任何变化,排名也没有明显提升——这个跳跃就值得怀疑。真实的变化通常是渐进的、多维联动的;伪造的数据往往只动一个数字,忘了动其他的。
|
检查项 |
方法 |
通过标准 |
|---|---|---|
|
查询快照 |
要求导出完整查询记录 |
每条提及都能追溯到具体查询,含时间戳、平台、账号环境 |
|
原始回答全文 |
要求导出 AI 完整输出 |
能看到品牌出现的完整语境,不是摘要或截取段落 |
|
引用来源 URL |
要求逐条列出引用链接 |
每条引用可点击、可访问,指向具体页面 |
|
复测一致性 |
干净环境复测同批问题 |
多次复测结果与服务商报告在合理偏差范围内 |
|
负面与错误提及 |
要求书面说明幻觉识别方法 |
被标记的提及有报告,无静默剔除 |
|
数据逻辑自洽 |
交叉核对四个维度 |
提及率、引用源、排名、情感的变化方向一致 |
验收的终点不是报告,而是决定续费、调整还是换服务商
验收的终点不是报告,而是决定续费、调整还是换服务商。报告只是中间产物,决策才是目的。G2 对 1,076 位 B2B 决策者的调查显示,69% 的买家因为 AI 给出的答案换了供应商——这意味着 AI 可见性已经直接关联到商业结果,验收不合格的代价不是“白花一笔预算”,而是“正在丢单却不自知”。AirOps 对 300 多位营销负责人的调查则显示,只有 23% 的人有信心度量 AI 搜索到底在起什么作用。换句话说,大多数团队拿到手的报告,连“该不该续费”这个问题都回答不了。验收要做的,就是把报告翻译成三个动作:续费、调整、换服务商。
对决策层:如果三件事都答不上来,这笔预算就该重新评估。 三件事是:被提到没有、引用了谁、有没有带来点击。这三件事分别对应 AI 可见度的三个层次,缺任何一件,报告都不足以支撑续费决策。CMO Survey 第 35 版的数据提供了一个参照:41.5% 的 VP 及以上表示在做 GEO,但只有 11.6% 把“管理 GenAI、GEO 和 Bots”列为能力缺口——说明多数决策者还没意识到,自己手上拿到的报告可能只是方向性数据,不是决策级数据。决策层不需要看原始数据,但需要一张能直接拍板的矩阵:
|
验收结果 |
行动 |
|---|---|
|
三件事都有数据,且分平台、分问题类型报告,原始回答可复现 |
续费,进入下一轮优化 |
|
只有提及率有数据,引用来源和点击归因空白 |
要求服务商限期补齐,否则暂停续费 |
|
三件事都无数据,或数据不可复现、无法追溯 |
换服务商,或收回内部自建 |
这张矩阵的用途不是惩罚服务商,而是把“感觉不行”变成“哪一项不行”。决策层最怕的不是效果差,而是说不清效果差在哪。矩阵把模糊的不满拆成可验证的缺口,续费、调整还是换人,就有了依据。
对执行团队:根据验收结果调整优化策略,而不是重做一遍报告。 验收暴露的问题,必须落到三个具体动作上:哪些问题该占、内容发到哪、怎么验证占住了。如果验收显示某些问题类型跑偏率高、品牌从未被提及,那就从五区里挑出空白区和敌占区,重新排优先级;如果引用来源里官网占比极低,那就把内容预算从自有阵地转向 AI 实际采信的信源结构;如果复测发现答案不稳定,那就固定提问集、固定时段、留存原始回答,把“占住了”变成可重复验证的结果。执行团队要产出的不是新报告,而是一份调整后的优化任务清单,每一条都对应验收里发现的一个具体缺口。
对数据团队:把验收数据接入内部看板,持续监控,而不是验收完就归档。 验收产生的原始回答、复测记录、引用来源快照,应该进入日常监控流。固定提问集,分引擎、分时段采集,连续两天未被引判定为结束,这样内容续航天数、提及率波动、引用源变化都能自动呈现。数据团队要做的不是每次验收时临时跑数,而是把验收口径固化成看板指标,让异常波动能触发预警。这样下一轮验收时,不需要从头解释口径,直接对比趋势就能看出优化有没有生效。
验收的终点是决策,而决策的质量取决于数据能不能被复现、被追溯、被持续观察。三件事答不上来,预算就该重新评估;三件事答得上来,续费、调整、换人都有据可依。
局限与边界
这套方法有三个前提:AI 搜索确实进入了目标客户的真实决策路径;品牌已经在该平台上留有可被引用的内容;团队有能力做分平台、分问题类型的持续监测。不满足其中任何一条,验收结果要降级使用。
不适用或需要降级的情况:
- 品牌所在问题集太小或太偏,AI 本来就不会点名。比如只测品牌词、或者测的问题天然不产生品牌提及,此时提及率、引用来源、点击三件事都会接近空白,这不是服务商的问题,是问题集选错了。应先缩小到真正影响信息型选型的问题,而不是拿品牌词硬测。
- 品牌内容还没有铺到 AI 实际采信的体裁和信源。此时引用来源验收会长期显示“官网占比低、自媒体占比高”,但这未必是执行失败,可能是内容供给本身不符合 AI 引用结构。验收重点应放在能否看清信源结构,而不是直接判定续费。
- 点击归因只能得到相关性,不能单独得到因果。品牌词搜索量上升可能叠加了其他营销动作;短链和 UTM 也会受 AI 平台不展示链接、改写链接或降低信任度影响。因此点击数据只能作为辅助证据,不能单独用来计算 AI 搜索 ROI。
以下是原文数字的边界,读者不应过度外推:
- A1 的五引擎信源结构数据,是在 2026 年 7 月对豆包、DeepSeek、文心一言、通义千问、腾讯元宝被引来源抽样统计得到,是特定时间、特定样本、特定引擎的结果。引擎信源结构会随算法和内容供给变化,40%–70% 的自媒体占比不能当成任何行业、任何时段都成立的常数。
- A2 的分行业官网被引占比是实测数据点,行业间差异很大(科技软件 25% 到汽车 5%)。不能用某一行业的百分比去套另一行业,也不能把表里的数字当成必须追到的目标值。
- 餐饮类内容平均续航天数 5.3 天、工业类 3.9 天,来自我们按“连续 2 天未被引判定结束”这一口径的内容续航天数监测。它只描述当时监测样本下的存活时间,不是所有内容在 AI 引用里的半衰期。判定口径、问题集、监测时段不同,续航天数会跟着变。
- 外部数据各有边界:SparkToro 的 ChatGPT 约 0.2% 引荐流量是特定观察窗口的引荐流量占比;Webflow 的 LLM 流量转化率是 Google 的 6 倍是单一平台案例,不是行业普遍转化率;G2 的 69% 买家因 AI 答案换供应商来自 B2B 决策者调查,AirOps 的 23% 来自 300 多位营销负责人调查,CMO Survey 的 41.5% 和 11.6% 也有特定样本构成。这些数适合做量级参照,不适合直接写进 ROI 公式。
最后,这套方法验的是“品牌在 AI 回答中的可见性和可追溯性”,不是 SEO 排名,也不是广告转化。如果企业把 GEO 当纯 SEO 或纯品牌曝光来验收,会出现指标错配:用排名验收时,AI 回答本身没有稳定排名;用曝光验收时,AI 对品牌描述是否有利、引用是否可控才是关键。先确认验收目标与这套方法匹配,再决定投入多少去复测和留档。
常见问题
GEO效果怎么验收?
验收只看三件事:AI有没有提到你、提到时引用了谁、有没有人因此点进来。三件事都能追溯到原始数据才算数。具体做法:要求服务商提供分平台分问题的提及率、逐条引用来源、点击归因数据,并自己抽样复测。
GEO服务商提供的报告可信吗?
大多数报告只给提及率或排名,属于方向性数据,不能支撑决策。可信的报告必须满足IAB Decision-Grade八项标准:样本量、查询量、提问类型覆盖、测试频率、可复现性、数据校验、方法学文档、平台覆盖。你可以问服务商:这个数怎么测出来的?再测一遍还是这个数吗?原始回答留了吗?
AI搜索的点击怎么追踪?
传统分析后台看不到AI搜索的点击,因为AI平台不传递referrer。可以用UTM参数或短链追踪,但AI平台可能不展示链接。更实际的方法是:在AI回答中出现的落地页加独立追踪参数,或者用专门的归因工具。注意:ChatGPT仅贡献约0.2%引荐流量,但LLM流量转化率可能是Google的6倍,所以绝对值小但价值高。
提及率多少算合格?
没有统一合格线。提及率必须分平台、分问题类型看,因为不同问题天然产生提及的概率不同(五区:优势区、竞争区、敌占区、歧义区、空白区)。你应该先确定自己关心哪些问题,再分别看提及率,而不是看一个总数。
怎么判断GEO服务商有没有造假?
要求提供原始回答全文和查询快照,自己用干净环境(无历史对话、无个性化)复测同一批问题。如果结果对不上,或者服务商拒绝提供原始数据,就要警惕。另外,检查引用来源是否真实可访问,是否是你主动发布的内容。
基于中立监测底座的 GEO 研究与实践,持续提供可核验、可执行的行业内容。