2026年自己做GEO优化怎么做?四步从AI基线到可验收
2026年自己做GEO优化,应先测AI基线、按AI回答点谁分五区、追踪引用源/描述正误/续航,杀掉定义题后按优先级排任务,否则预算会被浪费。读者能拿到四步可验收操作法:固定问题集测基线,基于731条问题实测,优势区仅9条、敌占区189条、空白区202条;空白区跑偏率13.3%,有品牌名的问题仅5%-7%;补三张表,引用源里自媒体达人占40%-70%,餐饮内容续航5.3天、工业类3.9天;选词时杀掉定义题,145个扩展词里生成式引擎优化仅占0.01%;最后按空白区先占位、歧义区先纠错、敌占区评估、优势区维护排序,产出带验收字段的任务清单,让预算能改变AI答案。
本文要点
- 2026年自己做GEO优化,应先测AI基线、按AI回答点谁分五区、追踪引用源/描述正误/续航,杀掉定义题后按优先级排任务,否则预算会被浪费。
- 读者能拿到四步可验收操作法:固定问题集测基线,基于731条问题实测,优势区仅9条、敌占区189条、空白区202条;
- 空白区跑偏率13.3%,有品牌名的问题仅5%-7%;
第一步先测基线:动手前先看清AI现在怎么说你
没有基线的优化,最后只会变成一堆无法结算的动作。你花出去的时间和钱,如果换不来一个能向老板交代的“提升”,就等于白干。所谓基线,就是你在动手改任何内容之前,把 AI 现在怎么回答你关心的问题、提到了谁、引用了哪些来源,原样拍下来。之后任何一次复测,都是拿这张照片和后来的照片比。
对决策层:这笔钱该买到的是一张可比较的底片。 你现在批这笔预算,不是为了听服务商说“我们发了多少篇稿”,而是为了将来有一天能坐下来,看着前后两个数字说清楚:AI 对我们的提及从多少变成了多少、引用了我们官网的次数有没有增加、把我们描述成什么样还没有出偏差。没有这张底片,所有“提升了”“见效了”都只是一面之词。我们的实测里有一组数据可以说明为什么基线必须先测:在 1047 条问题、执行了 731 条的抽样里,AI 的回答能不能点名品牌,和问题类型强相关——有明确品牌名出现的问题,跑偏率只有 5% 到 7%;一个品牌都不出现、只让 AI 泛泛科普的“空白区”,跑偏率跳到 13%。你不先分清哪些问题本来就不可能点名,后面就会把预算砸进一批天然产不出提及的坑里。
对执行团队:开工第一件事不是写内容,是做一轮基线检测。 做法很直接:固定一张问题集,至少 20 条,覆盖四类——品牌词(“XX 品牌怎么样”)、品类词(“这个品类里哪个好”)、场景问句(“预算两万想买什么”)、竞品对比词(“A 和 B 哪个适合我”)。拿这些问题,在同一时段、同一设备上,逐个去问豆包和 DeepSeek,预算允许再加文心一言和腾讯元宝。每次提问后,把回答原文完整存下来,顺手把回答末尾的引用来源也截图或复制。这张表就是你的基线。不要急着优化,先看三件事:每个问题里出现了谁、谁排在前、引用源是什么类型。这一步人工也能做,但会撞到两个墙:一是要同时问多个平台、每个平台答案还变,手动记录容易漏;二是一周后再复测时,能否用完全一样的提问口径,直接决定前后能不能比。这两点做不好,基线就是废的。
对数据团队:基线操作的技术口径要在一开始定死。 至少三条:第一,问题集固定后不要中途修改,如果必须改,旧问题和新问题分开记录,不能混在一起算提及率;第二,保存回答全文的时候,不要只记“提到了”“没提到”,要连引用 URL 一起保存,否则后面追不回来,这是 IAB 4P 框架里 Presence(有没有被提到)之外我们刻意补的一条——提到时引用了谁,才是判断信号质量的根据;第三,记录方式统一成表格:每条问题一行,列的问题 ID、引擎名、回答里出现的品牌名及顺序、引用源归类(官网/媒体/达人/平台页/无引用)、爬取时间。你回头就能查,这比一堆截图好用。关于“传统词表有大量非目标意图”这一点,我们有一个独立的 Bing 关键词实测可以引证:拿“geo”当种子词往外扩,145 个扩展词总共 4630 万印象里,地图导航占了 91.66%,真正的生成式引擎优化只占 0.01%。这说明如果直接搬传统搜索的词表来测 AI,大部分问题跑偏是必然的——先测基线,才能把预算对准真正有机会出现品牌位的那部分问题。
基线做完了,记住一个限制:你看到的答案是当时当刻的,换个时间、换个账号问,答案可能变。所以基线不是一张永远正确的表,它是一张“在某一刻、用某一组问题、问某一个平台”的快照。它的价值不在绝对准确,而在让之后的每次复测都有同一个起点可以比。
基线按AI回答点谁分五区:每一区动作不同
分区不是给关键词打分,而是画地形图。很多团队拿着关键词表就开干,却不知道有些问题AI根本不点名,有些问题AI点名却说错——不区分的话,投入会撒在注定无果的地方。把你关心的每个问题,按“AI回答它的时候说了谁”分成五种:优势区点你的名且靠前,竞争区点了你但竞品在前,敌占区只点竞品,歧义区点了你但说错品类、功能或与同名品牌混了,空白区一个品牌名都没有。
自己花半小时就能做一次分区。挑20个你最在意的问题,打开豆包或DeepSeek逐个问,只记两件事:出现品牌名了吗?出现的是谁?不用买任何工具,做完就有了一张初步地形图。这张图直接决定预算该往哪放:优势区不需要再买曝光,重点守住别让竞品挤掉;敌占区是被对手占着的问题,攻进去才有增量;空白区没有任何品牌,先到先得,但AI最容易跑题,投入前要标记清楚。
对决策层,分区等于画出品牌在AI里的地形:自己的地盘守,对手的地盘攻,没有品牌的地方先到先得。这个判断有实测支撑:我们执行了731条问题,分布是优势区仅9条、竞争区114条、敌占区189条、歧义区217条、空白区202条。也就是说大部分问题并不在自家手里,真正要拿的是敌占区和空白区。这比任何一张“提及率总表”都更接近真实的战场形状。
对执行团队,分区结果直接变成行动清单:优势区做监控,发现竞品冒头就补信源;竞争区逐条拆为什么竞品排前,能追的追,追不动的先放;敌占区选和业务强相关、又没有人认真做的先攻;空白区先识别哪些问题值得做,再做内容占位。不要平均用力——五区动作完全不同,这正是把“发文章”和“做优化”分开的关键一步。
对数据团队,判定规则要写死,否则区间边界会漂。五区判定标准:优势区点你的名且排在前面;竞争区点了你但竞品排在你前头;敌占区只点竞品,从头到尾不提你;歧义区点了你但说错了——品类错、功能安到别人头上、和同名品牌混了;空白区整段回答里一个品牌名都没有。还要注意:跑偏率随区域单调上升。有品牌名且说得对的三个区(优势、竞争、敌占)跑偏率在5.4%到6.6%之间;歧义区升到9.0%;空白区跳到13.3%。分区时一定要把“回答明显跑题”单独标出来,不能全量算进提及率。
|
分区 |
AI回答特征 |
该做什么 |
实测条数(731条样本) |
|---|---|---|---|
|
优势区 |
点你的名且靠前 |
守:监控,竞品冒头就补信源 |
9 |
|
竞争区 |
点了你但竞品在前 |
争:逐条拆差距,能追的追 |
114 |
|
敌占区 |
只点竞品,不提你 |
攻:选强相关且无人认真做的先打 |
189 |
|
歧义区 |
点了你但说错品类/功能/同名混淆 |
纠错:对照官网事实,补高置信信源 |
217 |
|
空白区 |
一个品牌名都没有 |
先到先得:识别值得做的问题再做占位 |
202 |
只测提及率不够:还要看到引用了谁、说对没有、活几天
只测提及率,等于只记了“AI有没有念到你的名字”,但没记它念到的时候是夸是骂、念的是哪页纸、以及这篇答案过两天还在不在。提及率是对的,该用,但它回答不了一个关键问题:这次被提到对你究竟是资产还是负债。
对决策层:你花钱买来的“被提到”可能正在劝退客户。 AI 提到你的时候,可能把你归到错误的品类、把竞品的短板安在你头上,或者用“规模较小”“功能基础”这类描述一笔带过。出现比不出现更糟——因为一个正在选型的人看到这段回答,可能直接把你划掉。IAB 的 4P 框架里,这叫做“被怎么描述”(Portrayal),它下面有四个具体检查项:情感倾向是正是负、语境是褒是贬、有没有幻觉或事实错误。这四件事任何一件出问题,你花钱买到的那次提及就是负资产。这就是为什么只验收提及率不够:它只对四个维度里的第一个负责,剩下三个没人管,而你承担全部后果。
对执行团队:把基线扩成三张表。 在已经有提及率的基础上,补三张就会够用一半——引用源表、描述正误表、续航表。
|
表名 |
看什么 |
怎么记 |
它说明什么 |
|---|---|---|---|
|
引用源表 |
每条 AI 回答末尾的引用来源,来自你官网、专业媒体还是自媒体达人 |
对同一批问题,每次记录引用 URL 的域名,按官网/专业媒体/自媒体达人三类打标计数 |
你的内容被谁背书;官网占比低,说明你把自己的阵地让给了别人 |
|
描述正误表 |
AI 提到你时说你是什么,有没有与竞品混淆、归错类、张冠李戴 |
把 AI 提到你的段落原话截下来,逐句标注“对/错/误导”,错在哪个点 |
出现不等于有利;错误描述会直接劝退客户 |
|
续航表 |
同一批问题隔几天再问,之前被引用的来源还在不在 |
固定问题集,隔日或每日采集,记下被引 URL 及内容片段是否还在回答里 |
一次被引有生命周期;有些内容活不过一周 |
对数据团队:三张表分别对应三套判定规则。 引用源表按官网/专业媒体/自媒体达人类别计数。我们自己的五引擎实测(A1)显示,自媒体达人在所有引擎里都是第一大信源,占被引来源的 40%–70%,腾讯元宝高达 70%;而专业媒体占比最高的是通义千问,为 33%。这意味着不同引擎的信源偏好差异很大,引用源表必须分引擎单独计数,不能合成一个总数。
描述正误表对应 IAB 4P 的 Portrayal 维度,需要逐条比对 AI 描述与你官方资料的差异,判定四个细项:情感倾向、语境框架、幻觉(AI 编出不存在的功能或数据)、事实错误(AI 把竞品的信息安到你头上)。至少每周跑一次,对重点负面描述做回归跟踪。
续航表按 A4 口径执行:每日同一时段用固定提问集采集,以被引 URL 或其内容片段出现在回答引用来源中判定为“被引”,连续 2 天未被引判定为“结束”。我们的实测里,餐饮类内容平均续航天数为 5.3 天,工业类为 3.9 天。如果你的内容续航明显低于行业平均,说明采信链路有问题,需要回头查引用源表里权重高的信源是否已经把你替换掉。
选问题先杀定义题:不产品牌曝光的词占再大流量也没用
先杀定义题,再谈优化——把传统 SEO 词表直接搬进 GEO 监测,等于花钱盯一批 AI 永远不会点你名字的词。
许多团队开工第一件事是把搜索量大的词铺满。但 AI 搜索里,提问方式决定回答体裁:用户问“什么是 GEO”,AI 只能给一段科普,没理由点名任何品牌;用户问“GEO 工具哪家好用”,AI 不点名就没法完成回答。前者是定义题,后者是选型题。拿你的词表对一遍,给每个词只问一句:用户要的是一段解释,还是一份可选名单?只有后者才真正有品牌位。
对决策层,预算压错词的损失在数据上非常具体。 我们的一次 Bing 关键词实测:以 geo 为种子扩展出 145 个词,总印象 4630 万,其中地图导航类占 91.66%,“生成式引擎优化”仅占 0.01%;geo vs seo、geo seo、seo geo 三个词合计每月约 324 次。如果预算压在“生成式引擎优化”这类听起来专业但没有真实搜索量的词上,你花的钱连被 AI 调用的机会都没有。定义题在搜索引擎时代能带来流量,在 AI 时代不产生品牌曝光——这是两套完全不同的选词逻辑。
对执行团队,开工前把关键词表分成两类,只把选型题放进监测清单。 定义题留给官网知识页当科普存量,不占监测预算;选型题才是主战场。下面这张表可以直接拿去跟团队对齐:
|
关键词类型 |
用户意图 |
AI 回答体裁 |
有无品牌曝光 |
处理方式 |
|---|---|---|---|---|
|
定义题:什么是 GEO |
要一段解释 |
科普定义,不点名任何品牌 |
无 |
留给官网知识页,不进监测清单 |
|
选型题:GEO 工具哪家好用 |
要一份可选名单 |
点名多家工具并对比 |
有 |
放进监测清单,按品牌位排序追踪 |
对数据团队,用种子扩展法做一次自检。 拿行业关键词做种子跑扩展,统计这组词的搜索意图构成。如果“XX 优化”这类词在印象里的占比跟“生成式引擎优化”一样低到 0.01%,说明词表整体偏离了真实用户的提问意图。更快的检查不需要工具:对每个词问一句“用户要解释还是要名单”,回答不了这个问题的词,直接从监测清单里删掉。先杀定义题再谈优化,否则你监测的是一批注定没有品牌位的词。
诊断完要产出任务清单:先排序再动手,别每处都动一点
没有优先级,优化预算就会被稀释在十几个动作里,最后每个问题都只动了一点,没有一个 AI 答案发生变化。诊断出问题只是第一步,真正的优化是从“看报告”进入“决定先改哪一个”。这是从“发现问题”到“改变答案”的决策点——不做排序,团队就会每处都试一点,结果每块都没明显变化。
对决策层:优化是决策结果,不是发文章动作
诊断表上可能有几十个问题,预算不可能全压。排序要按一个原则:先动那些能让 AI 答案真正发生变化的位置,而不是把预算均匀撒在每个漏洞上。
优先级依次是:
- 空白区先占位——AI 谁也不点,谁先提供它能引用的高密度内容,谁就有机会第一个被写进答案。先到先得,成本最低。
- 歧义区先纠错——AI 点了你的名,但说错了,或者安到别人头上。这是品牌伤害最大的区域,每多存活一天都在劝退潜在客户。
- 敌占区评估代价——AI 只点竞品不提你。要评估抢回来的成本和胜率,不是所有敌占区都值得上。
- 优势区只维护不追加投入——你已经排在前面,守住即可,别把新预算投到这里去锦上添花。
这个排序的意义在于:预算流向的是能改变答案结果的地方,而不是平均发稿。不排序的最大风险,是钱花完了,十几个问题还是每个都只动了一点点,复测时没有一个答案发生变化。
对执行团队:任务清单必须写到能验收为止
排序之后就落地成任务清单。每条任务不能只写一个模糊动作,要写清楚以下七个字段,否则执行完无法结算。
|
字段 |
说明 |
|---|---|
|
问题 |
固定的提问句式,复测时原样使用 |
|
当前区 |
优势区 / 竞争区 / 敌占区 / 歧义区 / 空白区 |
|
目标区 |
优化完成后期望落在哪个区 |
|
动作 |
只写一个动作,不写“加强内容”“提升曝光”这类无法勾销的说法 |
|
产出物 |
可核查的 URL 或文件 |
|
验收指标 |
必须绑定复测问题,按 IAB 4P 选一个维度 |
|
优先级 |
P0 / P1,按本节排序规则定 |
示例一行:
|
问题 |
当前区 |
目标区 |
动作 |
产出物 |
验收指标 |
优先级 |
|---|---|---|---|---|---|---|
|
某 B2B 产品对比词 |
空白区 |
优势区 |
发布一份带实测参数对比表的内容 |
已发布内容 URL |
复测该问题出现品牌名(Presence) |
P0 |
最关键的是“验收指标”这一栏。每条任务必须绑定一个复测问题:优化动作完成后,用同一个问题、同一个引擎重新跑,把新答案和基线答案比对。不要写“提高提及率”——那不叫验收,叫 KPI 口号。按 IAB 4P 选维度:空白区看 Presence 是否从 0 到 1,歧义区看 Portrayal 是否修正,优势区看 Prominence 是否守住。能让 AI 答案产生可验证变化的动作才值得上 P0。
对数据团队:排序规则要能复现,不能凭感觉
排序的依据不应该是“哪个动作好做”,而应该是“哪类问题体量大、哪类问题 AI 最容易跑偏”。
先说一个需要知道的判断:跑偏率,就是 AI 回答偏离提问原意的比例。你可以自己验——拿同一个问题问五遍,数数有几遍并没有回答你问的问题。A6 实测里,有品牌出现的几类问题跑偏率在 5.4%~6.6%,歧义区升到 9.0%,空白区最高,到 13.3%。也就是说,越是没有品牌被点到的区域,AI 越容易给出答非所问的回答。空白区体量也最大,A6 分出来的 1047 条问题里空白区 202 条、歧义区 217 条,两类加起来超过四成。这就是为什么优先级要往空白和歧义倾斜——不是拍脑袋,是它俩同时满足“体量大”和“跑偏高”两个条件。
落到操作上,每条任务必须绑定一个复测问题,不是绑定一批主题。复测问题是固定的一句话,前后测试用完全一样的措辞、同一引擎、同一时段跑,拿到原始回答全文,再和基线那一次对比。只有动作+复测问题+验收指标一起出现,这个任务才算可结算。没有复测问题的“优化”,做完只能看发布稿数,看不见 AI 答案有没有变。
人工能做到哪一步,工具从哪里接手
人工能把诊断出的问题按五区分好类,也能在每个区里列出候选动作。但到了几十个任务要排序的时候,人很容易滑向“哪件容易做”而不是“哪件最影响 AI 答案”。尤其是空白区和歧义区量一大,哪些是“有把握的空白”“有把握的纠错”,靠人工逐个评估,判断会不稳定。
排序这一步由策略 Agent 接手:综合可见度数据、竞品动态、信源分布,自动定位曝光短板,生成带优先级(P0/P1)的优化任务清单,并且给每条任务挂上对应的复测问题和验收指标。人工只做最后的确认和资源分配。顺序始终是——先用工具做完检测,再由 Agent 做排序和决策,把人从几十条任务的优先级拉扯里解放出来。
内容往三种体裁投:榜单、教程、评测合计占AI引用七成五
AI 回答里被引用的内容,75% 来自榜单、教程、评测这三种体裁;纯资讯文章只占 4%,单一品牌案例只有 1%。也就是说,把预算花在新闻稿和单篇客户故事上,在 AI 引用的世界里几乎等于零曝光。
对决策层:这条判断直接改变预算分配的起点。传统内容预算的大头通常压在品牌故事、新闻发布、客户案例上——这些内容在搜索引擎时代有流量价值,在 AI 引用时代几乎不产生品牌可见度。AI 在回答选型类、对比类、怎么选类的问题时,需要的是能直接拿来当答案用的材料:一份把同类产品排开的榜单、一篇能照着做的步骤教程、一段有对比细节的实测记录。这三类内容合计拿到七成的引用份额,是因为它们本身就能独立构成 AI 回答的答案——而不是需要被打断、总结、再加工的信息。预算应该按这个结构重新切:如果你今年有 100 万内容预算,先把至少 70 万押在这三类上,剩下的再去补行业媒体和官方信息的空白。新闻稿该发还发,但别把它算进 GEO 的内容投入。
对执行团队:具体怎么做分两步。第一步,把内容产量按体裁配齐——不要平均分配,按 AI 引用偏好排优先级。教程类能拿到 25% 的引用份额,而且教程天然适合拆成多篇(一个话题拆入门、进阶、踩坑三篇),效率最高;榜单类拿到 28%,是份额最大的单一体裁,但制作成本也高——一份榜单要覆盖足够多的对象、有真实的横向对比,才能被 AI 当成可引用的列表;评测类占 22%,关键在于要有可对比的细节数据,不是"用了感觉挺好"。纯资讯和单案例几乎不用为 GEO 专门安排产能。第二步,按行业决定渠道布局。官网被引占比不是一个恒定数,行业差异极大:科技软件 25%、企业服务 21%、教育 16%——这三个行业还能靠官网内容拿下一部分引用;但文旅只有 7%、快消 6%、汽车 5%,官网在 AI 引用里几乎是个透明的存在。这些行业的内容必须投在第三方阵地:专业媒体、达人内容、聚合平台的榜单页。以汽车为例,只靠官网发内容,等于把钱投进了一条占比不到二十分之一的通道。另外有一条行业例外:生活服务类内容里,带结构的体验型内容(散文式、有具体场景和感受的)被引权重是榜单的 2.9 倍,比榜单自己的 1.9 倍还高——这类行业不要套用"先做榜单"的通则,先做真实体验内容。
对数据团队:A3 的口径是 2026 年 7 月对五大引擎被引来源的抽样统计,按真实引用事件加权,账号级判定。使用这个数据时要注意一件事:它是"被引内容"的体裁分布,不是"你发了什么"的体裁分布——这之间隔着 AI 引用行为的筛选。你在后台看自己内容的体裁分布可能是 60% 资讯、20% 案例,但 AI 实际引用的世界里资讯只占 4%。所以检验自己内容库有没有对齐,不是看产量占比,是看被引占比:把你们目前已被 AI 引用的内容拉出来,按体裁分类,看是否也落在榜单/教程/评测这个区。如果大量引用来自资讯或其它散类,说明你们的引用是偶然性命中,不是结构性优势。另外注意,这个 75% 是五引擎的合计,引擎之间存在差异,逐引擎拆开看时,哪类内容在哪个引擎更吃香是不同的——投完内容后的监测粒度至少要分引擎,不能只看一个汇总数。
验收只看三件事:出现没有、排位变没变、错误描述纠没纠
GEO验收不是数发了多少稿,而是同一批问题下,没提到的有没有出现、提到的排位变没变、错误描述纠正没有。这三点分别对应IAB 4P框架里的三个维度:Presence(有没有被提到)、Prominence(排在第几)、Portrayal(被怎么描述)。每个维度都需要独立验收,不能用一个加权总分掩盖三件事各自的真相。
"已发布12篇内容"不是一个成绩。它是过程指标,证明的是"你做了动作",证明不了"动作产生了结果"。而结果只能从同一批问题的答案变化里读出来。
对决策层
这是唯一能向老板说明这笔投入买到了什么的口径。
你把同一批问题在优化前和优化后的AI回答并排放在会议室桌上:左边是没出现你品牌的十道题,右边是今天出现的那几道;左边是排在竞品后面的那个位次,右边是现在的位次;左边是把你的功能安到别人头上的那段描述,右边是纠正之后的描述。这三组对比,不需要解释任何专业术语,任何一个老板都能看懂钱花在了哪里。
反过来,如果你的服务商只能给你"已发布32篇内容"这个数字,你就该问一句:这32篇里,哪一篇的回答里出现了我们的名字、现在排第几、那段描述会劝退客户还是吸引客户。答不上来的报告,第一次可以容忍,第二次就是浪费预算。
IAB对"决策级数据"有一条明确要求:度量结果必须可复现。拿这个标准去套你手上的验收报告——如果对方说不清"怎么测出来的"和"再测一遍还是不是这个数",那这份报告的定位是方向性参考,不是预算依据。把方向性数据当决策级数据用,就是IAB原话里写的失败方式。
"发了多少篇"这个口径一年前还能勉强说得过去,现在不行了。因为做的人80%以上,能度量的人只有6%到23%——这个缺口意味着,能拿出可验证验收数据的人,本身就比做内容的人稀有,这是你的真实竞争优势,不要主动放弃。
对执行团队
验收的证据包只有三样东西:
基线答案和复测答案的并排对比。 同一个问题,第一轮跑出来的回答原样留存,第二轮跑出来的回答原样留存,两张截图放在一起,变化读得出来。
每轮原始回答的截图或全文。 不要只记录"提到了/没提到"这样的一行字。原始回答是证据,勾选框只是KPI。AI给出的具体措辞才决定这次提及是在帮你还是在劝退客户。
引用源清单。 你的品牌能在一条回答里出现,是因为AI从某个来源读到了你。问清楚它引的是谁——是你自己的官网、你投的媒体稿、还是某个第三方平台。回答了"引用了谁",你才知道往哪里继续投。
用这三样东西去替代"已发布12篇"作为成绩单,还有一个直接好处:当竞品排名突然超过你、或者品牌描述突然出错的时候,你能拿出上个月的原始回答,证明这是新发生的变化,而不是一直如此。这种能力在内部汇报里极少有人具备。
具体执行标准:同一批问题在同一时段复测(建议每周一次,至少连续4周)。因为AI回答有概率性,单次复测结果不足以做判断。A4实测数据显示,一条品牌内容在AI回答里的续航时间是3.9到5.3天——这意味着,如果你只验收一次,你测到的可能是它恰好被引用的那一天,而不是常态。反复测,记录被引的持续天数,才是兑现了"内容能活多久"这个维度。
对数据团队
复测的实验条件要锁死:问题集保持一致、提问时段保持一致、引擎版本保持一致、用户环境匿名化。不要换问题集、不要换时段、不要用API接口去测产品前端效果——API是调用裸模型,没有产品前端的系统提示、历史记忆和安全策略,给不出"真实用户会看到什么"的答案。
被引的判定规则:统一用URL或内容片段出现在回答引用来源中判定为被引。三个引擎口径一致,不加权,不合并。
三项验收指标和对位关系如下:
|
指标 |
怎么测 |
证据 |
判断标准示例 |
|---|---|---|---|
|
提及率变化 |
同一问题集跑基线,记录出现品牌的问题数,复测时比对 |
原始回答截图/全文 |
基线10/50 → 复测18/50 |
|
位次变化 |
在提到品牌的问题里,记录品牌相对竞品的位置,复测时比对 |
同一问题的基线/复测并排截图 |
基线第4位 → 复测第2位 |
|
错误描述消失比例 |
在出现错误描述的问题里,复测时检视描述是否已被纠正或不再出现 |
错误描述段落的原文留存+复测对照 |
歧义区4题 → 2题纠正 |
错误描述单独成项,因为它的优先级别高于提及率增幅。把品牌安错品类、把功能张冠李戴,比没被提到更伤。IAB的Portrayal维度包含情感倾向和事实错误,这些都需要原文留存才能判断,存一个极值KPI替代不了。
失败处理也要预先定义好:如果复测后提及率下降,先回查引用源,判断是内容过期被替换,还是竞品发布了新对比内容,本质是"我们的内容被替代";如果位次没变但描述变差了,那是内容本身的措辞问题,不需要投更多,需要改内容;如果错误描述没有被纠正,那是信源结构的问题——AI从占比高的低可信源读到了错误信息,要补的是更高权重的信源,不是再发一遍纠正声明。
所有原始回答必须留存,不只是KPI。这一点在IAB的Decision-Grade标准里是书面写的要求,不是建议。
人工撞墙点与工具接手处
人工只能测十几条问题,复测两次开始漏记;工具能做到的是固定问题集、固定时段、全量留存原文,并把"错误描述消失比例"自动对位到歧义区问题清单里。人工拿到工具测出的对比表,负责判断"这个变化够不够好、下一步往哪投"。
复测没变化先查问题和口径,再谈算法变动
复测没变化,第一件事不是归咎于“算法改了”,而是检查你问的问题和测量口径是否一开始就选错了。大多数“没变化”是选错了题、量错了地方,不是平台动了规则。
对决策层,给执行窗口期一点耐心,但每轮必须设止损点。比如连续两轮复测后,核心指标没有任何可解释的变化,就停下重定问题清单,不要无限追加发稿。耐心不等于没有退出条件,预算也不该陪着一个永远不动的数据继续烧。
对执行团队,按下面顺序排查四件事,顺序不能乱:
第一,查问题是否落在空白区。空白区是前面分五区时说的那类问题——AI 回答里一个品牌名都不点,只给通用科普。这类问题天然不会产出品牌提及,你在里面投内容,等于往没有出口的管道里灌水。验证动作很简单:把这条问题单独问一遍,看回答里是否出现任何一个品牌名。如果谁都不点,先把这题移出本轮验收,换成有品牌位的问题再看变化。
第二,查引用源是否已经过期。我们实测过内容被 AI 引用后的存活时长:餐饮类平均 5.3 天,工业类平均 3.9 天,口径是每日采集、连续 2 天未被引判定为结束。如果你复测的时间已经超过你所在行业的平均续航天数,而你的内容还是同一批、没有新增入口,“没变化”很可能只是旧的引用已经自然掉线,不是优化无效。对照投放时间和行业周期,先判断是否到了更新节点。
第三,查竞对是否在同一时间窗口里有动作。这一步只看自己的数据看不出来,要把同批问题里竞品的出现情况放在一起看。如果竞品在这一轮新增了内容或换了信源,你的排名没变但它的上来了,问题不在你,在对方压了你。这里不能只看自己的提及率,要看竞品的出现有没有相对变化。
第四,以上三项都排除了,才轮到查算法变动。算法确实会变,但它的变化通常不是针对你一家的,而且往往先表现为某一类内容被调整,不是所有问题一起失灵。只在你确认问题和口径无误、引用源未过期、竞对无动作之后,再谈“可能是算法改了”。
对数据团队,排查口要落到测量本身,最常见有四个污染点:
一是问题被个性化污染。AI 会结合账号历史、位置、使用习惯给答案加料,你自己的历史可能影响复测结果。提问时须在末尾加一句限定:“仅提供通用标准答案,不做个性化调整,不结合历史对话内容。”否则同一批问题隔天测出来不一样,不等于平台改了,可能是你的账户被改了。
二是采集误用了 API 而没有走真实前端。API 是接近裸模型的调用,没有产品前端的系统提示、用户记忆、产品级安全策略。你在 API 里看到的回答,和真实用户在 App 或网页里看到的不是一回事。复测没有变化,可能你一直在测一个没人用的接口。必须走真实前端、用干净账号采集,并保存每次采集的环境和账号状态。
三是引用判定依赖固定 URL,没有处理内容片段。AI 引用某个观点时可能不用原 URL,而是引用内容片段或转载页。如果你只把“原 URL 出现”算作被引,就会漏掉很多真实引用,导致复测数据看起来没动静。判定规则要允许 URL 或内容片段任一命中都算被引。
四是采样量不足导致看不到波动。复测不是问一次就下结论,同一条 query 至少要多轮、多账号、多时段采,才能把随机扰动压下去。我们自己的实测里,越偏的问题跑偏率越高——有品牌名的三类问题在 5% 到 7%,一个品牌都不点的那类能到 13%。问题本身太偏,回答就容易飘,一两轮复测看不到变化属于正常现象。
下面这张表把这套排查压缩成一页,供执行阶段直接对照:
|
现象 |
可能原因 |
验证动作 |
处理 |
|---|---|---|---|
|
同一批问题复测结果完全没变化 |
问题全落在空白区,或测量走了 API 缓存 |
单独问每一条,看是否点品牌名;核对采集端 |
移出验收,换有品牌位的问题;改用真实前端采集 |
|
引用源还是上一轮那几个,未新增 |
内容已过行业续航天数,旧引用自然脱落 |
对照行业续航天数,查看自己的投放间隔 |
在旧引用过期前补充新入口 |
|
自己排名没动,但竞品上来了 |
竞对在同一窗口有新的内容或信源动作 |
拉竞品出现情况与引用源对比 |
针对竞品新增信源补位,不盲目增加自己的内容 |
|
所有问题一起变,且与上次明显不同 |
平台算法或产品策略调整 |
用干净账号多轮复测,排除个性化污染 |
记录版本时间,归类为外部变动,调整应对方案 |
|
复测波动大,但无明显方向 |
问题本身太偏,跑偏率高,采样量不足 |
提高采样量,多轮多账号采集 |
先等基线稳定,再谈优化效果 |
人工排查做到前两步没问题,后面会撞墙。第三步竞对同时动作、第四步算法变动,以及四个测量污染点的逐条验证,都需要把同一批问题在不同时间、不同账号、不同端口下的原始回答完整留档,再横向对比。人工能记一两次,但记不了每天几百条查询的完整快照。
工具从这里接手:先用检测机制把原始问答快照留存、判断内容实际续航天数是否低于行业基线,再用分析机制自动区分“内容缺失、信源不足、竞品压制、算法变动”四类原因并输出优先级。顺序永远是先看清数据,再下归因结论。超过设定轮次仍无变化的,直接标为失败并记录原因,不要把复测变成一场没有尽头的循环。
四步固化成一张SOP:角色、产出物、验收节奏都定死
自己搭GEO优化,要做成,就把四个步骤固化成六周一轮的最小闭环;一次性突击,等于把钱扔进一个没底的盒子。
对决策层来说,这个闭环的意义是:预算再小也能跑,而且每轮结束都拿得出一张能对表的产出物。不需要先决定投多少,先跑一轮,用第6周的验收对照表和老板谈下一轮该不该加钱。六周节奏刚好卡在“能看到变化”和“团队不会疲惫”之间,也是我们实测里AI引用内容自然更替的时间窗上沿。
对执行团队,把排期钉死:第1–2周只做基线检测,把固定问题集问完、把原始回答存档;第3周做分析排序,按AI回答点谁的名把问题分成五类,找出缺口和优先级;第4–5周只做执行,按任务清单改结构、发内容、补信源;第6周验收,用同一批问题复测,拿结果和基线对照,再决定下一轮删什么、加什么。产出物一共五样:基线记录、五区表、任务清单、发布内容、验收对照表。指定一个owner,哪怕是自己,没有owner的SOP就是一张废纸。
对数据团队,所有复用要素提前固化:固定问题集、固定采样时段、固定记录模板、固定判定规则。每轮结束必须归档原始回答,不能只留汇总数。下一轮继续沿用同一批问题,否则比较失去意义。这一点和我们自己的实测习惯一致:AI引用内容有短生命周期,必须定频采集才能捕捉到何时消失;IAB也把可复现性和方法学文档列为最低要求,原始回答就是方法学文档的地基。
这张SOP真正的价值在于:它让“自己做”从依赖某个人的手感,变成一
常见问题
自己用豆包/DeepSeek测,结果每次都不一样,该怎么保证基线可信?
固定问题集、同一时段、同一设备或多轮平均是降低方差的办法;更重要的是留存每一次原始回答,验收时不拿单次结果说话,而是比一批问题的汇总变化。AI回答本身有概率性,所以“可复现”不等于每次一字不差,而是趋势可重复。
预算很少,能不能只做基线检测不做优化?
可以。先做一轮基线,隔一周再复测一次,你就能看到没有人工干预时的自然波动。这能防止你被“提升30%”这类话术误导,也能判断哪些问题本身有机会。
我做的行业很偏,AI回答都不提任何品牌,这正常吗?
正常,而且恰好落在空白区。A6实测里731条问题中有202条空白区,一个品牌都不点。谁先让AI有东西可引、有品牌名可点,谁就先占位。行业偏不代表没机会,只说明很多位置还空着。
GEO和以前做SEO选关键词有什么不一样?
SEO关心搜索排名和流量,GEO关心AI回答时点不点名你、怎么描述你。很多SEO流量词在AI里是定义题,不会有品牌曝光。先把词分成定义题和选型题,选型题才有优化价值。
基于中立监测底座的 GEO 研究与实践,持续提供可核验、可执行的行业内容。