GEO项目交付SOP:从诊断到验收的五个步骤2026
GEO交付不能从发稿开始,必须先做五区分区诊断,再定目标、改信源、监测续航天数、按IAB八项验收。诊断时1047条query中有202条落在空白区,跑偏率13.3%,是有品牌三区(5.4~6.6%)的两倍,直接发稿等于把预算投进没有品牌位的问题。目标不能只盯提及率:40.6%从业者把缺少度量与归因工具列为最大挑战,验收必须留存原始回答和复测记录。执行要先看信源结构:汽车官网被引占比仅5%、快消6%,自媒体达人在五引擎中占40%~70%,榜单/教程/评测体裁被引占比分别为28%/25%/22%。监测看续航天数,餐饮5.3天、工业3.9天,连续2天未被引即结束。读者拿到的是可直接复用的五步交付SOP、分区表和验收口径。
本文要点
- GEO交付不能从发稿开始,必须先做五区分区诊断,再定目标、改信源、监测续航天数、按IAB八项验收。
- 诊断时1047条query中有202条落在空白区,跑偏率13.3%,是有品牌三区(5.4~6.6%)的两倍,直接发稿等于把预算投进没有品牌位的问题。
- 目标不能只盯提及率:40.6%从业者把缺少度量与归因工具列为最大挑战,验收必须留存原始回答和复测记录。
GEO交付必须从诊断开始,直接发稿等于盲投
GEO 交付必须从诊断开始,直接发稿等于盲投。没有诊断,你根本不知道客户该占哪些问题、哪些问题天然没有品牌位,发稿再多也只是在空白区里打转。
对决策层:客户续费不是因为发了多少稿,而是因为看到了可验证的变化。State of AEO 2026 调查显示,40.6% 的从业者把“缺少度量与归因工具”列为最大挑战——客户最怕的就是钱花了却看不到效果。诊断是给客户一个可验证的起点:先看清 AI 现在怎么说他、引用了谁、哪些问题根本没人提他,再谈优化。没有这一步,项目从第一天就埋下扯皮隐患:你说有效果,客户说没看到,最后只能拿发稿量交差。
对执行团队:项目启动前必须完成五区分区,否则不进入执行。五区是把客户关心的每个问题,按 AI 回答时点了谁分成五种:优势区(点了客户且靠前)、竞争区(点了客户但竞品在前)、敌占区(只点竞品)、歧义区(点了客户但说错)、空白区(谁都不点)。我们自己的实测(1047 条 query)里,空白区有 202 条,跑偏率(AI 回答偏离提问原意的比例)13.3%,是有品牌三区的两倍。这意味着:如果直接发稿,有近两成的问题 AI 本来就不点名任何品牌,你发再多内容也进不去。先分区,把预算集中在有品牌位、能争的问题上,才是对客户负责。
对数据团队:诊断的数据采集方案要固定下来:固定提问集、分引擎、记录原始回答。具体操作:挑 20 个客户最在意的问题,打开豆包或 DeepSeek 逐个问,只记两件事——出现品牌名了吗?出现的是谁?半小时能做完,不需要任何工具。但必须把 AI 的原始回答整段存下来,因为后面验收要复测,没有原始回答就没法对比“答案变没变”。这一步是后续所有步骤的地基,做不扎实,后面的监测和优化都是空中楼阁。
第一步诊断:用五区分区,空白区的问题别投
诊断的第一步是把客户关心的问题按“AI 回答说了谁”分成五区,空白区的问题天然产不出提及,投了也白投。
五区不是抽象分类,是直接看 AI 回答里出现了谁、说对了没有。把客户的关键词表逐条问一遍,每条问题都会落进下面五个区之一:
|
区域 |
AI表现 |
跑偏率 |
动作 |
|---|---|---|---|
|
优势区 |
AI 点了你的名,还排在前面 |
5.4~6.6% |
守:保持现有内容与信源,防止被挤掉 |
|
竞争区 |
AI 点了你,但竞品排在你前头 |
5.4~6.6% |
争:补强被竞品压制的维度,争取位次前移 |
|
敌占区 |
AI 只点竞品,从头到尾不提你 |
5.4~6.6% |
攻:先搞清竞品被引用的信源,再针对性补内容 |
|
歧义区 |
AI 点了你,但说错了(品类错、功能安错、同名混淆) |
9.0% |
纠偏:修正错误描述,把正确事实送进被引信源 |
|
空白区 |
AI 谁也不点,只给一段通用科普 |
13.3% |
不投:这类问题天然产不出品牌提及,预算投进去等于归零 |
跑偏率是 AI 回答偏离提问原意的比例。有品牌名的三个区(优势、竞争、敌占)跑偏率只有 5.4~6.6%,而空白区跳到 13.3%,翻了一倍多。这说明:越是没有品牌位的问题,AI 越容易自由发挥,回答越不可控。把预算投在空白区,等于花钱买一段没有你、还可能跑题的科普。
对决策层,这张分区表就是预算地图。哪些问题值得争、哪些问题现在别碰,一眼能看出来。预算只投在有品牌位或能争到品牌位的问题上。没分区之前,提及率的分母里混着一批天然产不出提及的问题,这部分预算注定归零——分区就是把分母洗干净,让每一分钱都花在能产生品牌曝光的地方。
对执行团队,这一步不是内部做完就交差,而是要带着客户一起做分区。把客户的关键词表逐条归类,产出《问题分区表》作为项目基线。这张表要成为后续所有优化动作和验收的对照底稿:哪些问题从敌占区打进了竞争区、哪些问题从空白区被放弃、哪些问题在优势区守住了,都要以这张表为起点。
对数据团队,分区不需要复杂工具。用 20 个问题自测法就能快速判断:挑 20 个客户最在意的问题,打开豆包或 DeepSeek 逐个问,只记两件事——出现品牌名了吗?出现的是谁?半小时能做完,不用买任何工具。但客户的关键词表往往几百上千条,人工逐条问不现实,而且一次提问的结果有随机性,需要多次复测并留存原始回答。这一步人工做到 20 条就撞墙,批量执行和留痕要交给工具——后续步骤里的品牌排名监测和数据采集机制,就是干这件事的。
第二步定目标:把提及率升级为决策级指标
只按提及率收费,等于只对 IAB 四个维度里的第一个负责,剩下三个没人管,客户迟早会问“提到我但说错了怎么办”。把交付标准从“被提到”升级到“被提到、排得靠前、说得对、能促成行动”,不是加价,是让续费时拿得出可复现的证据。
对服务商老板来说,续费风险不在客户不认可 GEO,而在客户问“你给我的 40% 提及率,再测一遍还是 40% 吗”。同一份调查显示,只有 15.2% 的团队在用工具度量,而 40.6% 的人把“缺少度量与归因工具”列为最大挑战——这意味着谁先交付可复现的数据,谁就拿到了续费定价权。IAB 4P 框架把 AI 可见度拆成 Presence、Prominence、Portrayal、Persuasion 四个维度,只按提及率收费,等于只对第一个维度负责,剩下三个维度的风险全部由客户承担。客户现在不懂,但当他发现 AI 提到自己时说的是“规模较小、功能基础”,或者把竞品的短板安在自己头上,他就会回来找你。
对项目负责人来说,合同里必须写清四个 P 的验收口径,否则交付边界模糊,客户拿什么标准验收你,你就拿什么标准被挑战。下面这张表可以直接放进合同附件:
|
维度 |
客户问法 |
交付物 |
验收标准 |
|---|---|---|---|
|
Presence 有没有被提到 |
“AI 回答里提到我了吗?” |
提及率报告(按问题集统计) |
同一批问题复测,提及率可复现 |
|
Prominence 排在第几 |
“提到我时排第几?比竞品靠前吗?” |
位次分布与竞品对比 |
位次变化有原始回答截图佐证 |
|
Portrayal 被怎么描述 |
“提到我时说的是好话还是坏话?有没有说错?” |
描述原文摘录与情感标注 |
负面或错误描述被记录并触发预警 |
|
Persuasion 有没有促成行动 |
“用户看完会点我吗?会选我吗?” |
点击/转化归因(如可追踪) |
至少提供 AI 引荐流量或转化数据;若平台无法归因,合同中明确此维度为方向性数据,不作为硬性验收指标 |
注意第四行:Persuasion 目前多数 AI 平台无法提供从“被提到”到“点击留资”的全链路归因,强行把它写成硬性 KPI,只会逼着执行层造假。合同里写清“方向性数据”四个字,反而保护了双方。
对数据团队来说,交付物不是一张提及率报表,而是原始回答全文的留存与复测记录。只记一个数字,客户问“这个 40% 怎么来的”,你拿不出任何一条原始回答,这个数字就是废纸。操作上必须做到两件事:第一,每次采集时留存 AI 回答的完整原文,包括引用来源列表;第二,复测时用同一批问题、同一套提问方式再问一遍,对比答案变化。人工手动复制粘贴原始回答,量大且容易遗漏,工具可以自动采集并留存快照,复测时直接调取历史版本做 diff。这一步人工做到 50 条问题就会撞墙,工具接手后,留存和复测变成默认动作,而不是额外加班。
把目标定在决策级数据,不是让交付变重,而是让验收变轻——客户不再追问“你怎么证明”,因为原始回答和复测记录已经替他问过了。
第三步执行:先改信源结构,再发内容
执行优化不是先写稿,是先看 AI 现在引用谁、你的官网占比多少,否则内容发出去也进不了引用源。信源结构,就是 AI 回答末尾那些引用来源里,品牌官网、专业媒体、自媒体达人、平台聚合页各占多少。你可以自己验:挑 20 个客户最关心的问题,在豆包或 DeepSeek 上逐个问,只数每个回答的引用来源里有几条指向客户官网,算个占比。这个数直接决定预算往哪投——官网占比低的行业,把预算全押在官网和自有内容上,等于投进一条占比不到十分之一的通道。
对决策层,先看一组分行业数据:科技软件官网被引占比 25%,企业服务 21%,教育 16%,文旅 7%,快消 6%,汽车 5%。如果你的客户是快消,官网被引占比只有 6%,意味着 AI 回答里 94% 的引用来自别处。这时候让团队闷头写官网文章、做官网优化,钱就花错了地方。正确顺序是:先补信源结构,把内容铺到 AI 实际会引用的那些阵地上去,再谈内容本身。这不是说官网不重要,而是说官网在 AI 引用体系里只占一小块,不能当主战场。
对执行团队,信源结构数据直接决定内容分发渠道。五引擎实测显示:自媒体达人是所有引擎的第一大信源,占 40%–70%,腾讯元宝最高达 70%;通义千问的专业媒体占 33%,是五引擎里最高的。所以,如果客户的重点平台是腾讯元宝,优先合作自媒体达人;如果重点平台是通义千问,优先投专业媒体。内容体裁也要跟着信源走:榜单类内容被引占比 28%,教程 25%,评测 22%,而纯资讯只有 4%,单一案例只有 1%。这意味着执行团队应该把资源集中在榜单、教程、评测这三类体裁上,而不是发新闻稿或单篇案例。
对数据团队,采集信源结构数据的具体做法是:固定一批问题(建议不少于 50 条,覆盖客户的核心品类词、品牌词、对比词),在五个引擎上分别提问,记录每个回答末尾的引用来源,按“官网、专业媒体、自媒体达人、平台聚合页”四类打标,统计各类占比。注意要分引擎单独统计,不能合并——因为不同引擎的信源偏好差异很大,合并会掩盖问题。下面这张表是信源结构与内容渠道的对照,供执行时参考:
|
行业 |
官网被引占比 |
优先渠道 |
内容体裁 |
|---|---|---|---|
|
科技软件 |
25% |
自媒体达人为主,专业媒体为辅 |
榜单、教程、评测 |
|
企业服务 |
21% |
自媒体达人为主,专业媒体为辅 |
教程、评测、榜单 |
|
教育 |
16% |
自媒体达人为主 |
教程、榜单 |
|
文旅 |
7% |
自媒体达人为主 |
榜单、教程 |
|
快消 |
6% |
自媒体达人为主 |
榜单、评测 |
|
汽车 |
5% |
自媒体达人为主,专业媒体为辅 |
评测、榜单、教程 |
表格里的“优先渠道”和“内容体裁”是基于五引擎总体信源结构(A1)和体裁被引占比(A3)的推断,具体到某个客户,仍需以该客户所在行业的实测数据为准。但方向是明确的:官网占比越低的行业,越要把内容预算从官网挪到自媒体达人和专业媒体上,体裁优先做榜单、教程、评测。
第四步监测:用续航天数判断内容是否被引用
内容发出去只是开始,能不能被 AI 持续引用才是效果。续航天数比发布量更能说明问题——发布量是过程指标,续航天数是结果指标。一篇内容被 AI 引用一次可能是偶然,连续被引两周才说明它被真正采信了。
对决策层: 如果内容平均 5 天就被 AI 遗忘,说明内容没有被真正采信,需要调整策略,而不是继续加量。我们实测的两组数据可以当参照:餐饮类内容平均续航天数 5.3 天,工业类只有 3.9 天。这意味着你花预算铺出去的内容,大部分在一周内就从 AI 的回答里消失了。决策层要盯的不是"这个月发了多少篇",是"上个月发的内容,今天还有几篇活着"。如果续航天数持续低于行业均值,加预算是浪费;如果续航天数在拉长,说明内容策略开始生效,这时候才值得追加投入。
对执行团队: 项目负责人要建立日级监测机制,核心是固定提问集、分引擎、每日同一时段采集。具体做法:把优化过的内容对应的核心问题固定下来,每天在同一时间段向豆包、DeepSeek、文心一言、通义千问、腾讯元宝分别提问,记录每条内容是否出现在回答的引用来源里。产出物是一张监测记录表:
|
内容ID |
发布渠道 |
首次被引日期 |
最后被引日期 |
续航天数 |
状态 |
|---|---|---|---|---|---|
|
C-017 |
知乎专栏 |
08-12 |
08-16 |
4 |
已结束 |
|
C-023 |
行业媒体 |
08-10 |
仍在被引 |
11+ |
存活中 |
这张表每周更新一次,月底汇总成续航天数分布。执行负责人看这张表,就能回答"哪些内容被 AI 真正采信了、哪些发出去就沉了"。
对数据团队: 操作层按固定口径执行,不要自己发明判定规则。判定"被引"的标准是:URL 或内容片段出现在回答的引用来源中。判定"结束"的标准是:连续 2 天未被引。续航天数 = 最后被引日期 − 首次被引日期 + 1。这里有一个必须区分的坑:抓取不等于被引。我们实测过,真实 Googlebot 的请求里有 76.6% 不是内容请求,Bytespider 高达 93.2%,Bingbot 和 Baiduspider 分别是 39.9% 和 37.7%。也就是说,爬虫来抓你的页面,不代表 AI 会在回答里引用你。监测时只看"引用来源里有没有你",不看"服务器日志里有没有爬虫来过"。这两件事混在一起,续航天数就会虚高,整个监测就失效了。
续航天数这个指标的意义在于:它把"发了多少内容"翻译成了"内容活了多久"。验收时,发布量可以注水,续航天数注不了水——它是每天固定提问、逐条记录出来的,原始回答和引用来源都留痕,随时可以复测。
第五步验收:按 IAB 八项标准交付,不是发稿清单
客户要的不是发稿清单,是能拿去开会定预算的决策级数据。验收报告必须能回答三个问题:这个数怎么测出来的、再测一遍还是这个数吗、原始回答留了吗。答不上来这三问的报告,不管图表多好看,都不能支撑续费决策。
对决策层来说,验收报告是续费的核心武器,不是交付流程的最后一环。IAB 的原话值得直接放进报告封面:失败在于把方向性数据当成决策级数据来用,却没意识到中间的差距。方向性数据只能看个大概趋势,决策级数据要经得起八件事的追问。服务商老板最该盯的不是报告页数,是报告里有没有原始回答留存和复测记录——这两样缺任何一样,客户下一次比稿时就有理由换人。同一份调查里,40.6% 的从业者把“缺少度量与归因工具”列为最大挑战,这意味着谁先把验收做扎实,谁就在续费谈判里占了别人没有的位置。
对执行团队来说,IAB 八项标准不是学术清单,是客户会逐条问你的问题。每一条都要有对应证据,不能只写“已覆盖”。下面这张表就是验收会上的对答脚本:
|
标准 |
客户问法 |
交付物 |
是否满足 |
|---|---|---|---|
|
样本量 |
你测了多少条 query? |
总量、每品类条数、prompt 格式种类 |
少于 50 条直接判为探索性,连方向性都算不上 |
|
查询量 |
这些 query 从哪来的? |
关键词表来源、筛选逻辑、与客户业务的相关性说明 |
从传统 SEO 搜索量表直接搬来的,大部分是定义题,产不出品牌曝光 |
|
提问类型覆盖 |
定义题、选型题、对比题各占多少? |
按意图分类的 query 分布表 |
全是定义题的池子,提及率分母天然注水 |
|
测试频率 |
多久测一次? |
采集时间表、每次采集的日期记录 |
一次性测试只能说明那一天的状态 |
|
可复现性 |
再测一遍还是这个数吗? |
同一批 query 的多次测试结果对照 |
复现不了的数字不能进汇报材料 |
|
数据校验 |
你怎么知道抓到的答案是真实用户看到的? |
采集方式说明、是否走 API、是否模拟真实搜索行为 |
API 缓存数据与前端答案不一致,这是已知问题 |
|
方法学文档 |
你的判定规则写下来了吗? |
书面方法学文档,含幻觉识别方法 |
IAB 明确:缺少书面幻觉检测方法应被视为质量主张的实质性缺口 |
|
平台覆盖 |
各平台分开报告了吗? |
分平台单独展示结果,说明差异与加权方式 |
只给一个合成分数,等于把平台差异藏起来 |
这张表的使用方式是:每一条都问自己“交付物那一列的东西,我现在拿得出来吗”。拿不出来的那条,就是客户下一次会卡住你的那条。
对数据团队来说,验收的底线动作是两个。第一,原始问答快照必须全量留存、支持一键导出。不是存汇总分数,是存每一次提问的完整回答原文——只有原文才能在客户质疑“这个数怎么来的”时拿出来对质。第二,报告必须分平台单独展示结果,不能只给一个合成分数。不同引擎的答案差异本身就是客户该知道的信息,合成一个数等于替客户做了他不该委托给你的判断。
人工能做到哪一步:把八项标准列成清单、逐条核对、把原始回答截图归档,这些靠纪律就能做。但人工撞墙的地方在于——当客户追问“这 200 条 query 里有多少是定义题、多少是选型题”时,靠手工分类既慢又不可复现;当客户要求“把豆包和 DeepSeek 分开看”时,靠人工逐个平台重测的成本会随 query 量线性膨胀。工具从这里接手:按意图槽位自动分类 query 池,分平台采集并留存原始快照,复测时用同一批问题重新跑一遍、自动比对两次结果的差异。验收报告里的每一个数字,背后都要能点开看到那条原始回答。
失败处理与边界:没人能保证效果,能保证的是可验证
没人能保证效果,能保证的是效果可被验证。交付 SOP 里没有失败处理和边界声明,项目一定会扯皮——不是扯在效果好不好,是扯在“这算谁的”。算法变动、客户不配合、空白区天然做不动,这三件事在签约前不讲清楚,验收时就会变成三笔烂账。
对决策层,这一节要解决的是合同怎么写。GEO 效果受算法变动影响,这是机制决定的,不是服务商能力问题。上文那篇论文已经证明:能提升可见度的对抗性手段一定损害引擎效用,引擎有明确动力封堵。这意味着算法变动不是意外,是常态。合同里承诺“排名进前三”等于承诺一件你控制不了的事;但承诺“数据可复现、过程可追溯、每次变动有记录”是你完全控制得了的。把保证效果翻译成保证可验证,是这一节对老板唯一重要的事。
对执行团队,这一节要解决的是责任怎么界定。三件事必须在项目启动会上对齐,写进交付文档,而不是等出了问题再吵:
第一,算法变动导致提及率下降,算谁的。 判定标准不是“降了多少”,是“变动时间点前后,我们做了什么、平台改了什么”。如果平台改了信源权重,同一批内容在所有品牌上的引用都同步下降,这是平台侧变动;如果只有客户品牌下降、竞品没动,这是我们侧的问题。这个判定逻辑要在签约前告诉客户,让他知道你不会拿“算法变了”当万能借口。
第二,客户不配合提供素材,怎么处理。 诊断和优化都需要客户提供产品参数、真实案例、资质证明。客户不给,内容就只能写通用描述,而通用描述在 AI 引用逻辑里权重最低。SOP 里要写明:客户素材缺失导致的引用率不达标,不构成服务商违约;但服务商有义务书面列出“缺了哪些素材、缺了会怎样”,而不是事后甩锅。
第三,空白区问题做不动,怎么提前说。 诊断阶段已经分过区,空白区的问题天然产不出品牌提及。如果客户坚持要投空白区,执行团队要书面声明预期:这类问题优化后跑偏率仍然显著高于有品牌位的问题,投入产出比低,建议降权或放弃。客户签了字再投,就不是你的责任。
对数据团队,这一节要解决的是怎么记录才能分清“我们没做好”和“平台变了”。三个动作缺一不可:
记录每次算法变动的时间点。 平台官方发布、行业讨论、监测数据出现系统性跳变,都要打时间戳。没有时间戳的“算法变了”就是借口。
变动时间点与监测数据对照。 把提及率、引用源、续航天数的变化曲线叠在算法变动时间轴上,看是全局性下移还是单品牌下移。全局性下移是平台侧,单品牌下移是我们侧。
保留原始回答快照。 每次监测的原始回答全文留存,不存汇总数。出了争议,拿原始回答出来对,比任何解释都有用。这正是决策级数据那八件事里“可复现性”和“数据校验”的落地动作。
|
风险类型 |
触发条件 |
责任界定 |
处理动作 |
|---|---|---|---|
|
算法变动 |
平台调整信源权重或排序规则,全行业引用同步变化 |
平台侧,服务商不承担效果责任 |
记录时间点,与客户同步变动证据,调整策略后复测 |
|
客户素材缺失 |
客户未按清单提供产品参数、案例、资质 |
客户侧,服务商不承担引用率不达标责任 |
书面列出缺失项及影响,客户确认后继续或暂停 |
|
空白区投入 |
客户坚持投空白区问题 |
双方共同确认预期,服务商不承担提及率责任 |
书面声明跑偏率风险,客户签字后执行 |
|
竞品压制 |
竞品同期加大投放,引用份额被挤压 |
服务商承担策略应对责任 |
调整信源结构,补强高权重引用源,复测观察 |
|
负面提及 |
AI 回答中出现品牌负面描述 |
服务商承担监测与预警责任,不承担平台生成内容责任 |
触发预警,溯源引用源,提交整改方案 |
这张表不是给客户看的免责声明,是给项目负责人用的内部边界清单。每一行都要在签约前和客户过一遍,客户确认过的边界才是边界,没确认过的都是扯皮素材。
失败处理的核心不是“失败了怎么办”,是“失败之前怎么把话说清楚”。说清楚了,失败就是一次可归因的迭代;说不清楚,失败就是一场互相甩锅的烂账。
常见问题
GEO项目交付流程怎么标准化?
按五步走:诊断现状(五区分区)、确定目标(决策级指标)、执行优化(先改信源结构)、监测反馈(续航天数)、验收报告(IAB八项标准)。每一步都有明确产出和验收标准。
GEO项目怎么向客户证明效果?
用决策级数据:留存原始回答全文、复测同一批问题、分平台展示结果、按 IAB 八项标准交付。客户问“这个数怎么测出来的、再测一遍还是这个数吗、原始回答留了吗”,你能答上来。
GEO诊断怎么做?
挑 20 个客户最在意的问题,打开豆包或 DeepSeek 逐个问,只记两件事——出现品牌名了吗?出现的是谁?然后按五区分区:优势区、竞争区、敌占区、歧义区、空白区。空白区的问题天然产不出提及,别投。
GEO内容发出去多久能看到效果?
看续航天数,不是看发布量。餐饮内容平均5.3天、工业3.9天就被 AI 遗忘。如果内容平均续航天数低于行业均值,说明没被真正采信,要调整信源结构或内容体裁。
GEO服务商怎么验收?
按 IAB 八项标准逐条问:样本量多少、查询量多少、提问类型覆盖了吗、测试频率多少、可复现吗、数据校验了吗、方法学文档有吗、分平台报告了吗。缺一条,报告就不够决策级。
基于中立监测底座的 GEO 研究与实践,持续提供可核验、可执行的行业内容。