← 返回文章列表
实战方法14 分钟读完透镜GEO 研究组

geo采样和geo基线怎么做:2026年GEO效果验证第一步

GEO 效果验证必须先把问题按 AI 回答中是否点名品牌划分为五区,分别记录跑偏率和原始回答快照,才能避免提及率被空白区或定义题稀释。实测中跑偏率从有品牌三区的 5.4%–6.6% 升至歧义区 9.0%,空白区 13.3%;已执行的 731 条查询中,优势区只有 9 条、竞争区 114 条、敌占区 189 条、歧义区 217 条、空白区 202 条。采样量少于 50 条 query 只算探索性数据,基线要留存每次提问的完整原始回答,而不是只存一个汇总百分数,并且分平台单独报告。读者能拿到一套可复现的采样与基线步骤:先给查询打五区标签,人工跑 20 个问题半小时即可起步,再用原始回答快照和分区跑偏率作为验收证据,判断一份 GEO 报告

本文要点

  • GEO 效果验证必须先把问题按 AI 回答中是否点名品牌划分为五区,分别记录跑偏率和原始回答快照,才能避免提及率被空白区或定义题稀释。
  • 实测中跑偏率从有品牌三区的 5.4%–6.6% 升至歧义区 9.0%,空白区 13.3%;
  • 已执行的 731 条查询中,优势区只有 9 条、竞争区 114 条、敌占区 189 条、歧义区 217 条、空白区 202 条。

品牌词+通用词采样是高估效果的首要原因

如果你把关键词表直接从 SEO 拿过来,或者只挑几个品牌词加几个行业大词,得到的提及率既不能用来说"效果好",也不能用来说"效果差"——它只是算了一笔混着定义题和选型题的账。A6 实测里,跑偏率从有品牌三区的 5.4%–6.6% 跳到空白区的 13.3%,差一倍。这个差不是 AI 变得不靠谱,是提问方式变了:有品牌名出现的几类问题,AI 的回答还守着提问的边界;一个品牌名都不出现的问题,AI 开始自由发挥。你拿"自由发挥"的那批回答去数提及率,数出来的不是可见度,是 AI 的创作欲。

对决策层说,这个问题直接关系钱怎么批。你花几十万做 GEO,服务商给你一份报告,上面写着"提及率 62%"。你需要问的是:分子分母是什么。如果分母里混着"什么是 GEO""GEO 和 SEO 有什么区别"这类科普题,AI 不点名品牌是因为问题本身没要它点名——把从来不产出的田算进亩产,得出来的数对谁都有利,对谁都没用。反过来也一样:如果你拿全行业通用词去测,竞品的名字大量出现,你的提及率被稀释到个位数,那不是你不行,是这些词天然就不是给你准备的。看不懂分区,预算注定一部分要归零。

对执行团队说,你交付的数字能不能经得起客户复现,取决于采样阶段有没有区隔。客户不会自己分,但客户可能随机抽五个问题重新问一遍。他抽到"什么是 X 行业"这类定义题,回答里没有品牌名,他回来质问你:"为什么我的品牌没被提到?"如果你在采样时就把这类题排除在分母外,或者把它们的算法规格写清楚——定义题看准确性不看提及——这个质问就落不到你头上。否则,你的整个交付都会因为一个样本混入而被动。

对数据团队说,"跑偏率"在这里的操作定义是:读 AI 回答,判断它是否偏离了提问者最可能想要的答案方向。有品牌三区(优势、竞争、敌占)里,AI 被品牌名约束着,跑偏率低;歧义区里 AI 点错了名字,跑偏率到 9.0%;空白区里一个品牌名都没有,AI 索性讲一段通用科普,跑偏率 13.3%。这五个数字是同一批模型、同一批问题测出来的,差异完全来自提问类型。采样时必须先给每条 query 打类型标签,再按类型算指标。跳过这一步,后面所有的监测、归因、优化动作都是在给一笔糊涂账做精装修。

验证动作很简单,不需要任何工具:把你的关键词表打开,逐条问一句"这个问题,如果 AI 非常专业、非常客观地回答,它会不会点名任何一个品牌?"会点名的放一边,不会点名的放另一边。数一下后一边占多少。如果超过三分之一,你的提及率口径就已经失真了。这个问题对预算的意义在于:没分区之前,你没法知道哪些钱花在守优势区、哪些钱花在攻敌占区、哪些钱根本不该花——因为分母里的噪声把这些信号全糊住了。

意图槽位树是建查询集必须做的第一步

建查询集之前,必须先把每个问题按“AI 回答它的时候说了谁”分成五区。分区之后你才知道哪些问题能产出品牌提及、哪些根本不具备产出条件,后面的采样和基线才不会算错。

意图槽位树,就是把这份问题清单长成五张表:优势区、竞争区、敌占区、歧义区、空白区。这个动作不用买工具,自己就能做:挑 20 个你最在意的真实问题,打开豆包或 DeepSeek 逐个问,只记录两件事——回答里出现品牌名了吗?出现的是谁?半小时能完成。

跑偏率是 AI 的回答偏离提问原意的比例,自验方式就是读回答,看它答的是不是你问的那件事。我们自己的实测里,越是没有品牌位的区域,跑偏率越高:有品牌名的三个区在 5.4%–6.6%,歧义区跳到 9.0%,空白区 13.3%,翻了一倍。

区域

AI回答特征

跑偏率

应对动作

优势区

点了你的名,还排在前面

5.4%–6.6%

竞争区

点了你,但竞品排你前头

5.4%–6.6%

敌占区

只点竞品,不提你

5.4%–6.6%

歧义区

点了你,但说错

9.0%

纠正

空白区

谁也不点,只给通用科普

13.3%

暂缓或重新定义问题

对决策层来说,分区不是学术洁癖,它直接决定你看到的提及率是“可争夺问题集里的提及率”,还是被一批天然不产生品牌提及的问题稀释过的数字。我们自己的实测里,已执行的 731 条查询中,优势区只有 9 条,竞争区 114 条,而敌占区 189 条、歧义区 217 条、空白区 202 条。这就是为什么一份报告里的提及率可能是 40% 而不是 70%——分区之后,分母里只剩真正能产生品牌提及的问题。这也是给客户或老板解释清楚的关键。

执行团队接手的第一件事,不是补词表,而是把现有问题全部过一遍五区。尤其先处理歧义区:AI 提了你但说错,可能是品类错、功能安到别人头上、或与同名品牌混了。这类问题不纠正,提及率再高也是负资产。

数据团队建槽位树时,每条 query 至少留三个字段:原始 prompt、AI 回答原文、品牌是否出现及指代是否准确。人工做到 20 个问题是极限;扩展到几百个问题、五个引擎、双端、每日更新就会撞墙。透镜GEO 先按品牌排名监测机制抓取五个引擎的真实用户回答并标注品牌出现位置,再由策略生成优化任务按区归类、输出每区优先级清单。

采样量少于 50 条 query 只能算探索性数据

样本量少于 50 条 query 的监测,只算探索性数据——达不到方向性,更到不了决策级。客户拿这个数去开会定预算,没有依据。IAB《Measuring Visibility in the AI Era》的 Decision-Grade 标准写得明确:Query Volume 少于 50 条 query 的项目,直接判为 exploratory,连 directional 都算不上。说白了,跑二三十个问题得出的“提及率 63%”“排名上升 3 位”,只说明你看到了什么,不能支撑预算分配和续费决策。

对决策层来说,这条标准是一个现成的否决项。你不需要懂采样方法,只需要在验收报告时问一句:这批数字总共跑了几条 query?低于 50 条,不管图表多好看,它都属于探索性数据。IAB 设这个门槛,其实就是给甲方一把判断服务商交付深度的尺子——用少量问题测出来的可见度,波动大了可能只是随机。

对执行团队来说,交付前的自查顺序是:先看总量,再看覆盖。总量不到 50 条,先补量再谈基线。总量到了 50 条,也别急着自证合格:决策级要求大而多样的 query 集,覆盖品类与子品类,并披露总量、每品类条数、prompt 格式种类。也就是说,50 条是总数底线,不是每个品类都摊到几条就算覆盖。一个品类下只有两三条 query,那个品类的结论不可用;全部 50 条都是“哪家好/推荐什么”这类选型题,数据就只覆盖一种提问意图,报告写“品类覆盖”不成立。

对数据团队来说,50 条是地板,不是天花板。具体执行要留三个可追溯项:第一,query 总数按实际执行条数计算,设计过但没跑完的不算;第二,按品类和子品类拆开计数,报告里逐项列明;第三,prompt 格式单独列出来,比如定义题、对比题、推荐题、场景题各有多少条,让看报告的人能判断样本有没有偏。跨过 50 条门槛,只代表这份监测脱离了探索性,离决策级还差可复现性、数据校验、方法学文档、分平台单独报告等环节——那是后续几节的事,不是本节目标。

基线是原始回答快照,不是现在的提及率

基线不是“现在的提及率”,而是同一批问题在同一批平台上的原始回答快照。缺了原始回答,后续复测就无从对比——你只能知道数字变了,却不知道变在哪里。

对决策层:验收的前提是能回到现场

提及率是一个汇总后的百分数,它把“这次回答到底说了什么、引用了谁、描述准不准”全部压成了一个数。你可以拿它开会,但没法拿它追责。真正能支撑预算决策的基线,是服务商手里存着每一次提问的完整原始回答:哪一天、哪个平台、哪个问题、AI 原文是什么、引用来源列了哪些。你没有精力逐条看,但你需要确认对方拿得出来。拿不出来的报告,数字再漂亮也不能作为续费依据——因为它无法被复核。

对执行团队:把“原始回答留存”写进交付标准

跟客户签交付时,直接写明:验收材料包含全部原始回答快照,而不只是一个提及率报表。客户要什么就给什么,提前把证据准备好,别等被质疑“这个 45% 怎么来的”时才去补。项目启动第一天的快照就是基线,之后每次复测都拿同一批问题和同一批平台去问,对比原文变化。这个动作本身成本不高,但它是你自证效果、防止扯皮的唯一凭证。

对数据团队:留存的是证据,不是汇总表

每次抓取时,把 AI 的完整回答文本、引用来源列表、时间戳、平台、设备端原样保存,按“问题 + 平台 + 时间”建立索引。复测时用同一批问题再次抓取,逐条比对原文差异——哪些是新出现的品牌、哪些引用源换了、哪段描述变了。留存格式必须支持追溯到单次原始回答,不能只存一个百分数或一张汇总表。IAB 报告要求可复现性和方法学文档,说的就是这一步:再测一遍,还是这个结果,且原始记录随时可查。

跑偏率必须单独记录,否则整体数据被空白区带偏

不记录每个区的跑偏率,整体提及率会被空白区带偏——你以为AI在推你,实际是AI在瞎答。

跑偏率沿区域单调上升,这不是波动,是结构性的。A6 实测:有品牌的三类区域跑偏率只有 5.4%~6.6%;歧义区跳到 9.0%;空白区直接翻倍到 13.3%。

区域

跑偏率

说明

有品牌三区

5.4%~6.6%

AI 点名了品牌,答偏概率最低

歧义区

9.0%

AI 说了品牌但说错,跑偏率跳升一档

空白区

13.3%

AI 谁也不点,只有通用科普,跑偏率最高

跑偏率就是AI的回答偏离你提问原意的比例。你手上可能有一份报告,提及率数字不错,但翻开原始回答,有一部分根本没在答你的问题——你问"哪家GEO工具靠谱",它回你一段"生成式引擎优化是……",一个品牌名都没有。这个比例就是跑偏率。

怎么验证?把你采样里的每个回答完整读一遍,读到答非所问的地方标出来。会点名的区域跑偏少;AI 从头到尾不点名、只说通用科普的,跑偏最重。20个问题半小时能做完,不用买任何工具。

这意味着什么?跑偏率高的区,提及率里掺了AI的瞎答。这部分曝光对客户没有实际作用,不能写进效果汇报。

对决策层来说:跑偏率决定这份数据能不能拿进会议室。一个区的跑偏率超过10%,这个区的提及率就不该出现在预算论证里。跟董事会解释这笔钱值不值,不能说"提及率提升了8个点",得说"在跑偏率低于6%的问题上,提及率提升了多少"。跑偏率是数据质量的闸门,闸门没守住,下面所有数都不可信。

对执行团队来说:向客户汇报时把跑偏率作为质量指标展示,跑偏率高的区,提及率再高也不等于有效曝光。别只给客户看"提及率整体提升",先给一张分区表——哪些区的提及率是实的,哪些掺了AI瞎答。客户会拿这张表跟你对质,不如你先拿出来。

对数据团队来说:计算分两步。第一步,逐条读回答,判断是否偏离提问原意,做二值标注。第二步,按五区分组统计。判定时有一个坑:空白区没有任何品牌名,容易被顺手标成"偏离"——但要回到提问原意,别因为没点名就标偏。点名不是标准,答没答到点上才是。

人工能做到哪一步:样本量在几十条以内,人工逐条读、逐条标注完全可行,而且判定质量最高——跑偏本质上是语义判断,人读一遍最可靠。但样本量一旦到几百条、要跨五个平台每日复测,人工就读不过来了,判定标准还会随疲劳度漂移。

工具从哪里接手:自动化判定要先建立"提问原意"与"回答要点"的对照规则,再结合是否点名、点名是否正确辅助判断。可靠的做法是先让人工标注一批标准样本,把判定标准固定下来,工具照着批量判定,对结果抽检回验。

IAB 要求分平台报告,合成分数过不了客户那一关

不同引擎的答案分布不同,只给一个合成分数会掩盖平台差异。客户问“豆包和 DeepSeek 哪个表现好”时,合成分数答不上来,也交代不了预算花在哪。

对决策层,合成分数是个黑箱。你没法向老板解释“为什么豆包上的排名掉了、DeepSeek 却稳住了,总分没变”。只有分平台数据能回答钱花对没有。

对执行团队,交付报告里至少拆成两块:分平台数据表,以及合成说明。分平台数据表列出每个平台的提及率、引用源、位次、跑偏率;合成说明写清加权方式(是算术平均还是按平台用户量加权),并展示跨平台差异有多大。这一条不是我们的建议,是上面那份 IAB 标准原文的要求:必须分平台单独报告结果、展示跨平台差异、说明合成时怎么加权。只给一个总分,等于把标准往回退。

对数据团队,落地顺序是:同一批 query,每个引擎单独跑全量;每个引擎单独算指标;最后合成时把加权公式和差异表放进报告附录。如果某个平台的差异特别大,报告里要单独标注,而不是用一个平均分糊过去。

人工跑几十条 query 就到头了,工具接手才能规模化

人工手动跑几十条 query 尚可,但要做到每天复测、留存原始回答、分平台分区域报告,工作量会指数级增长——工具接手不是可选项,是规模化验证的前提。用纯人工的方式,你最多能回答“某一时刻、某一个平台、某一个版本答案里有没有我”,却回答不了“明天还在不在、换台设备变没变、五个引擎差多少”。而这些恰恰是决策级数据的最低门槛。

对决策层:预算里必须留出工具成本,否则验证动作做不实。
几十条 query 的人工采样看起来便宜,但它的价值天花板就是“看个大概方向”,离能拿去开会定预算还差得远。真实要交付的是持续复测:同一批问题每天跑、原始回答整段留存、分引擎单独出结果、有波动能回溯。这些动作靠人每天手动做,一个人一天最多盯二三十条,还无法保证提问方式稳定一致。成本的爆发点不在“第一次采样”,而在“第二次、第三次、第一百次”。所以决策层要问的不是“要不要工具”,而是“如果不工具化,这个验证项目的成本能扛几个月”。不预留工具预算,验证动作一定会在两三周后悄悄缩水,最后又退回“发稿数”的层面。

对执行团队:把采样与基线做成工具自动化流程,手工只做二次确认。
执行层最容易犯的错是:先手工跑一轮给客户看,等客户续约后再考虑工具。但第一次交付的基线如果不可复现,续约谈判就输了。正确做法是把采样与基线直接落在自动化流程上——每天固定时段、同一批 query、同一套提问格式,自动抓取 AI 生成答案并标注品牌出现的位置。人的角色退到二次确认:抽查是否出现异常波动、判断波动原因是否需要上报。这样项目规模才上得去,从一个客户扩展到十个客户,边际成本不会线性爆炸,而是基本持平。做不到这一步,团队就只能靠堆人,而堆人堆出来的数据还不可靠。

对数据团队:必须绕开 API 缓存,用真实用户搜索行为模拟。
API 接口拿到的往往是缓存或简化应答,不是真实用户在产品前端看到的东西。品牌排名监测的底层是每日自动模拟真实用户提问,抓取的是实际生成答案,同时标注品牌出现位置;真实用户搜索行为模拟则进一步摒弃 API 接口,采用 1:1 还原搜索场景的方式——模拟真人向豆包、文心一言、通义千问、DeepSeek 等平台提问,抓取实时流式答案,做到 7×24 小时日级更新。数据团队要关心的核心机制就一条:采集路径是否绕开了 API 缓存、是否保留了原始回答快照、是否支持分平台单独出报告。这三条缺一,后续任何复测和归因都无从谈起。

工具接手解决的正是人工撞墙之后的那一段:每天复测、留存原文、分平台分区域报告。人工能撑到几十条 query 的那一步,再往后,规模化的验证只能交给工具——不是因为它更省人力,而是因为只有它能把“复现”这件事变成日常,而不是一次性的表演。

常见问题

GEO采样怎么做?

先按意图槽位树把问题分成优势区、竞争区、敌占区、歧义区、空白区,再在每个区里按品类和子品类铺查询,保证样本量不少于 50 条 query,并记录每个区的跑偏率。

GEO基线怎么建?

基线是同一批问题在同一批平台上的原始回答快照。跑一遍查询集,留存每个回答的全文和引用来源,后续复测时对比同一批回答的变化。

GEO监测最少要多少条query?

IAB 标准规定,少于 50 条 query 的度量项目只能算探索性数据,达不到方向性更达不到决策级。实际项目建议按品类和意图槽位铺到百条以上。

为什么GEO监测要记录跑偏率?

跑偏率衡量 AI 回答偏离提问原意的比例。不分区记录,整体提及率会被空白区的高跑偏拉偏——实测空白区跑偏率 13.3%,远高于有品牌区的 5.4~6.6%。

IAB对GEO监测有什么要求?

IAB 的 Decision-Grade 八项标准要求:Query Volume 至少 50 条、必须分平台单独报告、必须书面说明幻觉与事实错误的识别方法、必须留存原始回答以保证可复现。

透镜GEO 研究组

基于中立监测底座的 GEO 研究与实践,持续提供可核验、可执行的行业内容。

相关阅读

文章 · 入门指南Agent驱动追溯AI 回答链路:一种深入分析生成式引擎如何回答用户提问的方法文章 · 实战方法2026年GEO监测工具推荐:先看这4个验证数据,别只看排名资讯 · 行业动态2026年国内专业GEO监控平台评测:助力品牌抢占AI“标准答案”资讯 · 产品更新企业GEO运营实战:如何快速查看品牌在AI搜索的曝光情况和真实排名?资讯 · 平台观察企业GEO优化如何入手?2026GEO运营实操指南文章 · 实战方法GEO项目交付SOP:从诊断到验收的五个步骤2026文章 · 实战方法GEO服务商三类:工具型、执行型、策略型,客户怎么选2026文章 · 实战方法2026年GEO监测工具推荐:8款实测对比,看能否回答三问题文章 · 实战方法GEO监测工具2026怎么用:服务商验收做4件事,缺一件别签

浏览全部深度文章 →浏览全部企业资讯 →