2026 GEO监测:四态判定分开竞争失败和选题失败
GEO 效果不能只看提及率:AI 答案是否给清单,决定一次“没被提到”是输给同行还是选错题,必须用四态判定分开统计。实测 731 条 query 里,27.6% 的空白区从头到尾不点任何品牌名,跑偏率达 13.3%,比有品牌名区域高出一倍;敌占区占 25.9%、竞争区占 15.6%,合计 41.5% 才值得做竞争分析。读者能拿到可执行的判定标准:决策层先要求从分母剔除无点名词,执行团队筛词时先问 AI 给不给清单,数据团队按“是否含品牌列表”留原始快照并分引擎统计,报告必须附四态分布表,不再接受单一提及率。
本文要点
- GEO 效果不能只看提及率:AI 答案是否给清单,决定一次“没被提到”是输给同行还是选错题,必须用四态判定分开统计。
- 实测 731 条 query 里,27.6% 的空白区从头到尾不点任何品牌名,跑偏率达 13.3%,比有品牌名区域高出一倍;
- 敌占区占 25.9%、竞争区占 15.6%,合计 41.5% 才值得做竞争分析。
只看提到没提到,会把两种完全不同的失败算成同一种输
只数“有没有被提到”,会把两种完全不同的输法记成同一笔账:一种是 AI 生成了清单但没选你——你输给了同行;另一种是 AI 根本没生成清单、整段回答一个品牌名都没有——不是你没被选中,是这类问题天生不产生选择。前者是竞争失败,后者是选题失败。两态监测把两者都算作“没提到”,预算就继续投进那批不产生任何品牌名的 query 里。
分开看这两类失败。
“洗地机推荐”“适合小户型的投影仪”这类问题,AI 的答案是一个候选列表。你不在列表里,说明你在“比谁更值得被选”这件事上输了,这是可以抢的。但“洗地机怎么选”“投影仪流明是什么意思”这类问题,AI 给的是一段科普,讲通用原则,从头到尾不点名。你在这后面补多少内容、做多少信源,AI 依然不会点名。不是内容不行,是问题的回答范式里没有品牌这个槽位。
IAB 的 4P 框架没有替你做这个区分。提及率衡量的是“你的品牌是否出现在答案里”,它只看结果、不看答案形态。同一个“没有你”的结果背后,可能是“有清单没选你”,也可能是“压根没有清单”。把这两个混在一个数字里,就会得出错误的结论:你以为自己在和对手抢一个位置,实际上这个位置并不存在。
实测数据说明了这个量级。我们的 731 条 query 里,空白区——答案一个品牌名都没有——占 202 条,27.6%。每四个词里就有一个,AI 从根上不打算提名任何品牌。
把这个数字放到报告里看:如果分母里混着 27.6% 的结构性死词,你的提及率提升空间直接被打掉四分之一以上。不是分子不行,是分母里有大量词根本产不出分子。
对决策层,这句话就够了:你看到的提及率数字被无点名词压低了,实际上的竞争表现可能比报告好看。先要求把“根本不产名牌的问题”从分母里摘出来,再评判这个数字。
对执行团队,接手词表的第一件事是筛词,不是写稿。把每个词实际问一遍,把“回答里从未出现任何品牌名”的词直接标记为无点名词,不投内容、不进之后的分母。
对数据团队,空白区的判定要写成可复现的规则,不能靠读一遍。判定条件是:该 query 回答全文里无品牌名、无候选列表、无排名比较,只有通用科普或方法论。同类问题至少跑三轮,三轮都不出现品牌名才算稳定空白,避免把单次随机波动判成结构性问题。
四态判定先问答案是清单吗,再谈你在不在里面
四态判定把每次 AI 回答分成四种情况——有名次、被提及无名次、未提及、答案本身不是清单——前两种和第三种看竞争,第四种看选题。这是把“没竞争过”和“选错题”分开的第一刀。
拿到一份关键词表,先别数“我们被提到几次”,先问一句:这些词里,AI 本来会不会给清单。打开豆包或 DeepSeek,输入“CRM 系统哪个好用”“项目管理工具推荐”,回答里会列出一串品牌名,这是清单型答案;输入“什么是 CRM”“项目管理流程是什么”,回答是一段科普,一个品牌名都不出现,这是非清单型答案。四态判定的第一步就是按这个分:AI 给不给清单。不给清单,你投再多内容也不会有品牌出现——不是做得不好,是这个问题本身产不出品牌曝光。
对决策层,这个分类直接决定预算怎么花。如果词表里六成以上的词是“答案非清单”这一态,那么再高的执行力也只是在给科普内容做贡献,花的是品牌预算,买不到任何心智位。决策层应该要求团队在汇报提及率之前,先报一个“清单率”——你关心的 query 里,有多少比例 AI 本来就会给品牌列表。没有这个分母,提及率这个分子毫无意义,因为分母里混着一批天然产不出提及的问题。IAB 的 4P 第一个 P 是 Presence(有没有被提到),但它没告诉你,有些问题 AI 根本不会点任何人的名。四态判定补的就是这一层:先确认答案有清单,再谈你在不在清单里。
对执行团队,拿到词表先做一次人工分拣:每个词手动问一遍 AI,只看回答形态,判断是清单型还是非清单型。这一步半小时能做完,不需要任何工具。清单型词继续进入监测和优化;非清单型词只有两条路:要么改写成清单型问法再监测(比如“什么是 CRM”改成“CRM 怎么选”),要么直接从考核词表里删掉。别在没有答案的问题上继续发稿,那是把预算往水里扔。我们的实测里,五区中的空白区——AI 一个品牌都不点、只给通用科普——跑偏率达到 13.3%,比有品牌名的几类(5.4%–6.6%)高出一倍以上。也就是说,非清单答案不仅没有品牌曝光,连回答本身都更容易偏离提问原意。这类词留着,除了污染报表,没有别的用处。
对数据团队,从采集环节就要把“答案形态”作为一个一级字段记下来,和提及率、排名、引用来源并列。判定规则很简单:回答中是否出现了并列的品牌列表、产品对比或明确推荐。没有,就标记为第四态“答案非清单”,并在报表里单独成组,不参与提及率计算。同时,对这组词单独统计跑偏率,作为选题失败的证据。这样每次复盘就能分清楚两件事:是竞争输了(清单里有别人没你),还是选题错了(根本没有清单可争)。前者值得改内容、抢位置;后者该换词、换问法,而不是继续加预算。
四态判定不替代提及率,而是把提及率放在一个正确的基础上。先问答案是清单吗,再谈你在不在里面。每笔 GEO 预算才说得清,它是在争一个席位,还是在改一道没有答案的题。
答案不是清单,是选题失败,换词比加预算有效
当 AI 对一个 query 给出的回答没有任何品牌列表时,这不是竞争失败,而是你把内容预算投进了没有答案的战场。
空白区不是少数边缘情况。在我们已执行的 731 条真实用户提问里,有 202 条属于空白区——AI 的回答从头到尾没有一个品牌名,只给一段通用科普,占比 27.6%。跑偏率更说明问题:空白区里 AI 偏离提问原意的比例是 13.3%,而有品牌出现的三区只有 5.4%~6.6%,高出一倍。这些词不仅不产生曝光,还更容易答非所问。
验证空白区不需要工具。挑 20 个你最在意的关键词,打开豆包或 DeepSeek 逐个问,只记一件事:回答里有没有品牌名。没有品牌名的,就是空白区。半小时做完,你会得到一个数:你的关键词表里有多少个天然没答案的词。
对决策层,空白区要单独从 KPI 里剥出来。如果 KPI 是提及率,空白区里的词永远得零分,不是团队不努力,是题目本身没有分数可拿。继续对这些词投预算,等于拿钱买一个注定归零的指标。要问的问题只有一个:现在考核的关键词里,空白区占比多少?把这一部分从提及率考核中剔除,预算转向有品牌位的词——这才是换词比加预算有效的意思。
对执行团队,人工识别空白区只能撑到几百个词。每周过一遍客户 query,把答案无清单的词标出来,移出 KPI,不要再用提及率考核这些词。具体动作是:每周人工过一遍,输出一张“无清单词表”,标注每个词在哪些引擎上是空白区。当客户要看的词从 20 个涨到 500 个,人工就会撞墙——不可能每周把 500 个词问五遍,再一条条判断答案里有没有品牌。撞墙点就是工具接手的地方:先由系统按“回答是否含品牌列表”把空白区自动标记出来,再由智能体生成“该换到哪些词、往哪个方向拓”的优化任务清单。人工做的是复核和拍板,不是当人肉计数器。
对数据团队,空白区的判定规则只有一条。AI 回答里没有出现任何品牌名,只给科普、定义或通用建议,就标为空白区。落数据字段时,采集端要加一个“是否含品牌列表”的布尔值,和跑偏判定一起存。五引擎分开跑,别合成一个数——同一个词在豆包是空白区,在通义千问可能不是,合成会掩盖问题。判定跑偏时,读完整回答,看它答的是不是问的那件事,偏离原意就标 1。
把空白区单独分出来之后,剩下的预算、KPI、投放才有得谈。不然你永远在为一个没有答案的战场付钱。
答案清单里没有你,才轮到做竞争分析
只有当 AI 的回答确实给出了品牌清单、而你的品牌不在其中时,这才是竞争失败;此时该做的是查信源差距和内容缺口,而不是再怪“这个 query 本就没清单”。
把“没出现”分成两种:一种是回答本身没有清单,那是选题失败,预算该砍;另一种是回答有清单且列了竞品,你缺席,这才是敌占区。我们的实测里,敌占区有 189 条、占 25.9%,说明超过四分之一的问题 AI 只点竞品完全忽略你;竞争区有 114 条、占 15.6%,有拉锯空间。两者合计 303 条,占已执行 query 的 41.5%。这意味着近一半的竞争问题值得深挖,但前提是先筛掉没有清单的 query。
汇报时,决策层要区分“我们没出现在一个有答案的地方”和“我们投了一个没有答案的地方”。前者可修,后者要砍。只有当答案里有清单、清单里没有你时,才轮到竞争分析;否则你分析的是一个根本不存在的战场。
执行团队落地时,先做一步验证:把问题原样输入豆包或 DeepSeek,看回答里有没有品牌列表。如果列表里有竞品但没有你,才开始查竞品信源、你的官网被引占比和内容缺口。不要一上来就怪“答案没清单”——那是前一种情况,处理方式完全不同。
数据团队的处理逻辑是:先给每条回答做“答案形态”分类——回答是否包含品牌列表?若否,进选题失败流程;若是,再看是否包含我方品牌。包含竞品但无我方,标记为敌占区;包含我方但排名靠后,标记为竞争区。只有这两个区,才是竞争分析的有效对象。
被提及但没进清单,你只是背景而不是选项
被提到但不进清单,等于没被提到——而且更隐蔽。AI 的回答里出现了你的品牌名,不意味着用户在选你。如果这个名字出现的位置是一段背景介绍、一个对比参照、或者一个用来衬托竞品的反例,那么这次提及不产生选择,甚至可能帮竞品建立“我比它好”的印象。
判断一次提及有没有用,先看品牌名落在哪个语义区块。用户问“企业级知识库工具哪家好用”,AI 的答案如果是“A、B、C 三家值得考虑,其中 A 的权限体系最完整”,那么 A、B、C 叫进了清单。如果答案是“该品类过去几年发展很快,早期玩家如 XX 从网盘转型,目前主流是 A、B、C”,那么 XX 被提到了,但没有进清单——它只是背景。
在我们的实测里,这种“提了但没用”不是边缘情况。1047 条 query 里,有 217 条(29.7%)AI 点了某个品牌,但把它归错了品类或安上了别人的功能。这是“被提及但被错误定位”的极端情形:名字在答案里,用户读到的是一个错误描述。它说明一件事——数“提到没有”是远远不够的,要看“提到的方式”。
IAB 的 4P 标准把“被怎么描述”单列成一个独立维度,和“有没有被提到”分开计。被当成背景的提及,恰恰是描述出了问题,而不是曝光达标。《Measuring Visibility in the AI Era》要求把每个提及放回上下文里读,而不是只数名字出现几次。
对决策层:只看提及率会高估预算效果。两个品牌提及率可能都是 60%,但一个每次都被列进推荐清单,另一个每次都是“成立于 2015 年的早期玩家”这种背景句。两者带来的选择量完全不同。向管理层汇报时,要把“被提及”和“被列入可选项”分开报,否则相当于把无效流量算成转化。
对执行团队:验收服务商时,别只接收“提及率上升”的结论。要求对方提供原始回答全文,逐条标注品牌出现在哪个区块——是推荐列表里,还是背景介绍、发展历程、竞品对照、负面举例里。判断标准只有一条:如果用户读完这段回答,会不会把品牌当作备选。不会的,都属于“被提及无名次”。
对数据团队:判定规则必须写死“哪个区块算清单”。同一个回答里,品牌名出现在推荐段落、榜单、对比表格的“推荐侧”,才算“有名次”;出现在背景说明、行业发展、早期介绍、参照系、反例等区块,判为“被提及无名次”。原始回答要整段留存,支持人工复核。人工在少量 query 下能逐条翻原文,但当 query 到上百条、五个引擎日更,逐条判定的时间成本和口径漂移会失控。工具在这里接手:品牌排名监测自动抓取并标注品牌出现的位置,品牌诊断把“被提及无名次”的原因拆到内容缺失或信源不足两类,引用来源追溯分析回查是哪个信源让 AI 把你当成了背景。关键不是自动化本身,而是每一次判定都有原始回答快照,可以被重跑、被复核——这才是决策级数据。
排进清单也不等于赢,位次之外还要看被怎么描述
有名次只解决了 AI 有没有提到你、排第几,但真正左右客户判断的是 AI 怎么描述你——语气是褒是贬、事实有没有错。IAB 4P 框架里这一维度叫 Portrayal,明确包含情感倾向、语境框架、幻觉率、事实错误率四项。我们自己的 1047 条 query 实测也印证了这一点:有品牌名的前三区,AI 回答偏离提问原意的比例只有 5.4% 到 6.6%;但到了歧义区,这个比例跳到 9.0%。也就是说,AI 可以一边把你放进清单,一边把你归错品类、把功能的来源安错,甚至把你的成立时间写错。
对执行团队来说,给客户的报告里,有名次的词不能只标位次,必须附上 AI 的完整回答,并标识情感倾向或事实错误。只给位次,等于默认这次提及是正面的,但一次劝退式的提及比没被提及更伤客户。客户下一次看到的若是一句“规模较小的创业公司”“功能相对基础”的描述,前面所有位次成果都会被打折。
对数据团队来说,Portrayal 的判定不能靠人工逐条读。必须留存原始回答快照,用情感分析和事实一致性检查找出负面语气与幻觉。事实错误尤其隐蔽:把竞品参数安到你头上、把融资轮次写错、把地域写混。这类错误不纠正,就等于把错误信息喂给下一个提问的用户。
要判断一次提及是资产还是负债,只需问三个问题:它说的是不是你的真实定位?语气是否有利于选型?有没有可核实的事实错误?三问里有一个出问题,这次“排进清单”就不构成赢面。人工读完几份答案还能判断,量级到几百条后只有靠工具才能持续监控;这正是监测环节里不能被位次数字替代的部分。
给客户的报告必须按四态分布,不再接受单一提及率
单一提及率数字不能再作为验收依据。服务商给客户的报告必须包含两张东西:四态分布表,和每一条提及对应的原始问答快照。没有这两样,报告里写多少百分比都不具备可验证性。这不是质量高低问题,是交付物是否成立的问题。
一个单纯的提及率把所有结果压成一个数字,客户既不知道哪笔预算投错了地方,也不知道哪些词需要继续加码。这个数字还同时掩盖了三件完全不同的事:有些 query 本身就不产出品牌清单,有些 query 产出清单但你被竞品压着,有些 query 你被提到了却被说歪了。三种失败,一种动作都对应不上。客户拿着这个数字只能做一件事——凭感觉续费或砍单。
四态分布表把这三种情况拆开,每一条 query 落到一个明确的态里。客户一眼能看出:我投进去的内容预算,有多大比例花在了根本不会出现品牌名单的问题上;在真正产生对比的问题里,我赢多少、输多少;我出现的那几次,AI 是在推我还是在拿我当背景板。每一态对应一个不同的预算动作——停掉无效词的投入、对竞争词补信源和内容、对描述错误的词做呈现纠正。这个表让客户从"看一个数字"变成"看一批决策"。
一个可落地的验收格式是:
|
四态 |
本期数量 |
占比 |
对应动作 |
|---|---|---|---|
|
有名次 |
34 |
12% |
维持并观察 Portrayal |
|
被提及无名次 |
71 |
25% |
找信源差距,补高被引内容 |
|
未提及 |
98 |
35% |
对照竞品信源结构,判竞争动作或放弃 |
|
答案非清单 |
80 |
28% |
从监测词表里剔除或改判,不投内容预算 |
这不是一个新指标,是把原来那个指标拆到能指导决策的粒度。上面的数字只是填满表格的形状,真实数字必须来自对客户词表逐条跑测后的结果。
原始问答快照的价值在于让上面的表可以被反问。客户问"你怎么算出 71 条被提及无名次?"服务商要能立刻调出这 71 次提问的原文、回答全文、品牌名出现的位置和上下文。没有原始回答,这个表跟纯数字没有任何区别——因为单次 AI 回答不可复现是已知事实,客户隔天自己再问一遍可能得到完全不同的答案。
这对服务商本身也是保护。客户最尖锐的质疑往往不是"你做得差",是"我怎么知道你做了"。把每一次回答原文存档、按 query 归类、可随时调取,等于把所有交付变成了可审计的记录。40.6% 的受访者把"缺少度量与归因工具"列为最大挑战,15.2% 的人实际在用工具——这个缺口意味着今天谁能提供可验证的度量,谁就在续费谈判里拿到了另一个人没有的筹码。
对决策层,这个要求可以压缩成一句:别再给板级的平均数,给一个能看出钱花错了哪里的分布。 延续的是同一个逻辑——我不需要你知道的每一个细节,我需要知道我下一步应该砍哪个、保哪个。
对执行团队,四态分布表配合原始问答快照,就是客户会拿出来问你的东西。提前把这张表做出来,比客户追着要的时候再拼更有主动权。每一轮复测都用同一批 query、同一套问题格式、同时段采集,表里的迁移才可读。
对数据团队,快照留存的最低标准是:检索时间、平台、Prompt 全文、回答全文、品牌名出现的位置、引用来源列表。多轮对话要记录轮次,流式回答要存完整落盘文本,不是只截取包含品牌名的那一段。
单一提及率做不到这些。它只能在一页纸里显得整洁。
常见问题
GEO监测只看品牌有没有被提到有什么问题?
只看提到没提到会把两种完全不同的失败混在一起:一种是答案本身就没给任何品牌清单(选题失败),另一种是给了清单但没选你(竞争失败)。前者继续投内容也不会产出位次,后者才值得投入竞争动作。
四态判定具体指哪四种状态?
四态判定先看 AI 答案是不是清单/推荐型结构,再看品牌位置:有名次、被提及但无名次、未提及、答案非清单。前两态属于竞争问题,第四态属于选题问题,必须分开统计和复盘。
怎么判断一个 query 是选题失败还是竞争失败?
把 AI 的完整回答拉出来看:如果回答里一个品牌名都没有,只给通用科普,那就是选题失败,应该从优化词表里剔掉;如果回答列出了竞品清单但你不在里面,那就是竞争失败,要查信源差距和内容改造。
四态判定和五区模型是什么关系?
五区(优势/竞争/敌占/歧义/空白)是现状分类,四态是验收口径。四态把五区里的空白区单独标成“答案非清单”,把敌占区标成“未提及”,避免客户把没答案的词当成输了。
给客户的GEO报告应该出现哪些指标?
至少要有四态分布表(有名次/被提及无名次/未提及/答案非清单各多少条)、每条 query 的原始回答快照、位次和情感倾向。单一提及率无法解释哪些预算被浪费,客户也无法验收。
基于中立监测底座的 GEO 研究与实践,持续提供可核验、可执行的行业内容。