综合

流量的第六次迁移:AI 搜索还没有计价方式,这意味着什么

在线营销三十年是一部计价方式的演进史:CPM、CPC、CPS、程序化竞价、MarTech 订阅制,每次媒介变革最终都沉淀为一种结算单位。生成式引擎是第一次出现「需求侧已形成、供给侧未定价」。本文基于 SEC 全文检索(30 家公司首次提及的完整时间线)、巨潮公告、IAB 度量标准全文、CMO Survey 第35版完整18项、12 份海外 GEO 岗位 JD 原文等一手材料,梳理甲方、乙方、流量平台与行业组织的真实动作,并给出可直接使用的采购与自查清单。

先给判断标准,三行看完可以决定要不要往下读:

  • 如果你是甲方:先看第三节的三条硬数字,它们决定你现在该不该投入、投多少。上市公司财报里已经出现的流量损失是 22%,而全球 27 个品牌里只有 6% 建立了明确的度量框架。
  • 如果你是乙方:看第四节。国内被资本炒作的两家 GEO 概念股都是广告代理公司,其中一家的毛利率是 2.69%——这解释了这门生意为什么急需一个新故事。
  • 无论哪一方:AI 流量至今没有稳定的计价方式。这不是暂时的,第二节会说明为什么它可能持续相当长一段时间,以及这段窗口期意味着什么。

一、三十年的计价方式演进,和一次中断

在线营销的历史,本质上是一部计价方式的演进史。每一次媒介形态的变化,最终都会沉淀为一种新的结算单位,而结算单位一旦稳定,整个产业链的分工、定价和考核就随之成型。

阶段

主流形态

结算单位

谁承担风险

PC 门户时代

展示广告、通栏、弹窗

CPM(千次曝光)

广告主

搜索引擎时代

竞价排名、关键词广告

CPC(点击)

双方分担

效果营销时代

联盟、导购、返利

CPS / CPA(成交/行动)

媒体方

程序化时代

RTB、DSP/SSP/DMP

CPM 为主,叠加实时竞价

广告主,但有算法辅助

MarTech 时代

CDP、SCRM、MA

不再按曝光计价,按席位/数据量订阅

甲方(工具成本前置)

生成式引擎时代

AI 回答中的品牌提及

暂无

暂无共识

前五个阶段有一条共同的逻辑:流量方先想清楚怎么收钱,然后产业链围绕这个收费方式重组。 CPM 时代诞生了媒介代理,CPC 时代诞生了 SEM 代运营,CPS 时代诞生了联盟平台,程序化时代诞生了 DSP 和监测第三方,MarTech 时代诞生了数据中台的一整套供应商。

第六个阶段目前是断的。 用户已经在 AI 里做决策,品牌已经在 AI 的回答里被提及或被忽略,但没有任何一方在为这次提及付费或收费

这是一个在广告史上不太常见的状态:需求侧已经形成,供给侧尚未定价。

二、为什么"抓到流量就是赚到"

2.1 流量方自己还没想清楚

先看目前唯一有实质商业化动作的一家。

OpenAI 在 2026 年 2 月上线广告。到 2026 年 7 月,美国区回答中出现广告的比例已达 51.0%,而在购物类查询中,带赞助标识的比例达到 76.4%。同时它计划在 2027 年 Q1 推出对话内成交并抽取佣金。

这组数字说明两件事:第一,商业化推进得很快;第二,它选择的路径是把传统广告位搬进对话,而不是为"被 AI 引用"这件事本身定价。

换句话说,即便是走得最快的一家,也还没有为"提及"设计出计价方式。它卖的仍然是广告位,只是位置从搜索结果页移到了对话流里。

再看国内。豆包、通义千问在做的是打通电商与本地生活的交易链路——把 AI 当成新的入口,但变现方式仍然回到平台既有的电商抽佣与广告体系。而 DeepSeek 到目前为止几乎没有任何商业化动作,它的回答里既没有广告,也没有商业排序。

对品牌方来说,这意味着一段特殊的窗口期:内容被引用是免费的。

2.2 免费不等于便宜,但确实便宜

需要说清楚"免费"的边界。被引用本身不收费,但要被引用,你得先有能被引用的内容,这部分成本是实打实的。

不过跟前几个时代比,相对成本确实低。CPC 时代你要为每一次点击付费,且价格随竞争抬升;程序化时代你要为曝光付费,还要额外承担监测和反作弊的成本。而现在,一篇写得足够结构化、有数据、有出处的内容,被引用多少次都不额外计费

这就是"抓到流量就是赚到"的准确含义:不是流量免费,是这段时间的边际成本极低。

2.3 这段窗口期会有多长

不好预测,但有两个观察可以参考。

第一,历史上从形态出现到计价成型,通常要几年。 搜索广告从雏形到 CPC 成为行业标准用了数年;程序化从概念到 RTB 生态成熟同样如此。生成式引擎的形态到现在也就两三年。

第二,标准化已经启动。 IAB 在 2026 年 8 月 3 日发布了《Measuring Visibility in the AI Era》,状态为 Final。工作组成员来自 Walmart、EMARKETER、Acxiom、WPP Media、Microsoft Clarity、PMG 等。

这份文件的意义不在于它规定了什么,而在于它是行业组织第一次尝试统一"AI 可见性"的度量口径。 而在广告业的历史里,度量口径统一之后,计价方式通常就不远了——因为可计量是可交易的前提。

所以更合理的判断是:这段窗口期是有限的,而不是永久的。 现在的低成本状态,本质上是标准尚未建立带来的红利。

三、甲方在做什么:认知很高,行动很浅

3.1 已经出现在财报里的损失

判断一件事是否真实发生,最可靠的证据不是行业报告,是上市公司在受法律约束的文件里怎么写。财报可以措辞谨慎,但不能编造。

我们检索了 SEC EDGAR 全文库中与 AI 搜索相关的十个"干净词"(排除了 AI-powered discovery、zero-click 等会被生物科技和专利诉讼语料污染的词),命中 152 份文件、60 家公司,其中 30 家明确提到 GEO 或 AEO

已经写进财报的具体影响:

公司

日期

披露内容

People Inc(原 Dotdash Meredith)

2026-08-03

Core Sessions 下降 22%,广告展示量随之下滑

Gambling.com

2026-03-19

披露 AI Overviews 月活约 15 亿用户、覆盖 200+ 国家

Chegg

2025-02-24 起诉

就 AI 摘要对流量的影响,向 Google 与 Alphabet 提起联邦反垄断诉讼

LegalZoom

2026-08-05

"零点击"搜索导致自然流量减少、获客成本上升

TripAdvisor

2026-08-06

AI Overviews 挤占原本排名靠前的位置,酒店板块持续承压

Yelp

2026-02-27

预期 2026 年流量继续承压

NerdWallet

2026-02-25

全年营收 8.37 亿美元、同比 +22%,但自然搜索承压,靠付费与非搜索渠道补上

NerdWallet 那条最值得玩味:营收在涨,但自然搜索在跌,增长是靠花钱买来的。这正是"流量结构变化"而非"生意变差"的典型形态——总量看不出问题,结构里全是问题。

3.2 认知度已经很高

The CMO Survey 第 35 版(Duke Fuqua 主持,Deloitte 与美国营销协会赞助)在 2026 年 1 月对 2,111 位美国营利性公司营销负责人发出邀请,308 人应答,其中 97% 是 VP 及以上

在"贵公司如何在营销中使用 AI"这道多选题中(n=188):

GEO 的采用率为 41.5%(±7.1%),在 18 个选项中排第 8。

排在它前面的是内容生产(73.9%)、内容个性化(65.4%)等更基础的用途。一个 2023 年底才被正式命名的概念,两年多后在 VP 级样本里达到四成采用率,这个速度本身就是信号。

3.3 但行动很浅

世界广告主联盟(WFA)在 2026 年 6 月 8 日发布《The Future of Discoverability》,调研覆盖 27 个品牌、累计全球广告支出约 310 亿美元

两个数字放在一起看:

  • 96% 认为 AI 生成式搜索会带来变革性或重大影响
  • 6% 已经建立了明确的策略、归属和度量框架

中间差了 90 个百分点。 另有 43% 的品牌把归属分散在多个团队共担——这通常意味着实际上没有人真正负责。

需要说明:这份报告的合作方是 DEPT®,一家代理商,即乙方。这不影响调研数字本身,但读的时候值得知道。

3.4 一个不能靠软文伪造的信号

白皮书可以写、案例可以编、首推率可以自报,但招聘要走审批、要进组织架构、要发真工资

海外方面,我们通过 Greenhouse 与 Lever 的公开 ATS 接口(无需登录)探测了 71 个公司板子,30 个可用,覆盖 5,551 个在招岗位,其中标题级的专职 GEO/AEO 岗位有 11 个

  • Stripe:Head of AEO & SEO(Performance Marketing 部门)
  • Asana:Head of SEO & AEO,薪资区间 $218K–$256K
  • Datadog:Senior Director, Growth Marketing – Organic Growth (SEO/GEO/PLG)

注意职级:Head of、Senior Director——这不是招执行,是招负责人。

国内也出现了甲方岗位。杭州美仪自动化(Supmea,工业仪表/过程自动化,非互联网行业,B 轮,近 600 人,2026 年 7 月启动 IPO 辅导)在招 GEO 优化师,薪资 15–30k·14 薪,职责包括追踪 AI 搜索引擎的算法更新、生产符合 AI 理解范式的内容、搭建品牌知识库、监测品牌在 AI 答案中的引用情况。

一家做工业仪表的公司为出海获客设 GEO 岗位——这比任何行业报告都更能说明渗透的广度。

不过这里要标注一个采样偏差:我们探测的公司清单以美国科技/SaaS 公司为主,零售、消费、金融品牌覆盖不足。所以"GEO 岗集中在 B2B SaaS"这个观感是采样造成的,不能当结论。 SEC 那批数据显示服装零售也在做,只是那些公司多用 Workday 或 iCIMS,不在本次覆盖范围内。

四、乙方在做什么:两条完全不同的进入路径

4.1 海外:从营销预算进入

海外 GEO 服务商的形成路径是常规的:需求出现 → 有人做工具 → 甲方设岗位 → 行业出标准

Reddit 上从业者社区(r/SEO、r/bigseo、r/marketing 等)近一年 990 条相关讨论里,工具被提及的次数是:

工具

提及次数

性质

Profound

76

纯做 AI 可见性

Semrush

72

老牌 SEO 大厂转型

Ahrefs

62

老牌 SEO 大厂转型

Otterly

14

纯做 AI 可见性

Peec

10

纯做 AI 可见性

专做 AI 可见性的 Profound 已经反超了 Semrush 和 Ahrefs 这两家老牌大厂。 这说明在海外,这已经被当成一个独立品类,而不是 SEO 的附加功能。

讨论量本身也在涨:2025 年 8 月 20 条,2026 年 6 月 140 条、7 月 149 条。(需说明:每次查询上限 100 条且老帖会被删,早期月份被低估,形状可信,绝对值偏保守。)

但态度值得注意。 海外从业者对 GEO 的主流态度是敌意,而且骂点集中在"你凭什么说你测得准",不是"优化 AI 可见性没意义"。

这一条推翻了一个常见预设。我们此前默认"国内骗局多是中国市场鱼龙混杂的特殊问题,海外更成熟"——数据不支持这个预设,海外骂得更狠、更集中。

而且海外的软文污染只是形式更高级:评赞比最高的几条"买家抱怨帖"里,作者在评论区自曝在做同类产品。结构与中文的"先坏后好"模板同构:真问题开场 → 末尾落到自家产品。

4.2 国内:从股票概念进入

国内的路径完全不同。

我们用巨潮资讯网(中国版 EDGAR)做了全文检索。这里有个技术坑值得一提:巨潮是分词检索不是短语检索,搜"生成式引擎优化"会被拆成"生成式"+"优化",返回 3,442 条噪音,必须在正文里做精确串匹配再过滤。(另外"豆包"会命中"红豆包装"——无锡红豆包装装潢印刷有限公司。)

精确匹配后的结果:7 份公告、4 家公司。

而这 7 份公告的性质是:股票交易风险提示。

以引力传媒(603598)2026 年 1 月 13 日的公告为例,原文写道:

"公司关注到有媒体将公司列为 GEO 概念股。目前,公司主营业务仍为广告代理服务……截至本公告披露日,公司 GEO 事业部仍处于组建筹划阶段。公司 GEO 业务尚未形成成熟的商业模式,其市场认可度及盈利模式均存在不确定性,该业务尚未形成相关收入。"

背景是:2025 年 12 月 30 日至 2026 年 1 月 12 日,公司股价累计上涨 79.60%,动态市盈率 283.20、市净率 36.85,而所处行业静态市盈率 32.49、市净率 2.23。

核心反差在这里:


海外

国内

进入路径

营销预算

股票概念

触发方式

招总监 → 写进 10-K → 出度量标准

股价异动 → 交易所问询 → 被迫澄清

主角

甲方品牌

乙方广告公司

而且被炒的两家都是乙方广告代理公司,不是甲方。

4.3 一个财报数字解释了乙方的动机

引力传媒 2025 年前三季度:营收 64.62 亿元,归母净利润 2,036.02 万元,毛利率 2.69%(同比下降 1.73 个百分点)。

营收 64 亿,净利两千万;毛利率不到 3%,还在继续下滑。

这个数字比任何分析都更能解释:广告代理这门生意的传统模式已经很难支撑,所以急需一个新故事。 GEO 恰好在这个时点出现。

这不是说所有转型都是投机——引力传媒在 2026 年 4 月 28 日的《提质增效重回报行动方案》里写了具体方向(生成式引擎优化服务、面向电商平台 A2A 交互的商品信息重构服务)。但理解这个财务背景,有助于判断某些服务商话术的成色

4.4 那个"提升 40%"是从哪来的

市面上大量 GEO 服务商引用"GEO 能提升 40% 可见度"。这个数字的源头是可以追溯的。

它出自论文《GEO: Generative Engine Optimization》(Aggarwal 等,KDD 2024,arXiv 2311.09735,首次提交于 2023 年 11 月 16 日)。原文表述是 "can boost visibility by up to 40%"

三个前提在传播中被掐掉了:

  1. "up to"(最高可达)被读成了"平均可以"
  2. 测量是在作者自建的 GEO-bench 基准集上做的,不是真实流量
  3. 提升的是生成式回答中的可见性,不是营收,也不是转化

更值得注意的是论文的立场。原文是防御性的——为内容创作者争取权益,针对的是生成引擎的黑箱不可控,作者明确写道"we must ensure the creator economy is not disadvantaged"。

而市面上卖的 GEO 是进攻性的:把同行挤下去。

同一个词,两个相反的框架。

五、流量平台在做什么:三种截然不同的姿态

5.1 OpenAI:把广告位搬进对话

前面提过数字,这里补上判断。

2026 年 2 月上线广告,7 月美国区回答广告出现率 51.0%,购物类查询赞助标识率 76.4%,2027 年 Q1 计划做对话内成交抽佣。

推进速度很快,但路径是保守的——它复制的是搜索广告的成熟模式,只是把广告位从结果页搬到对话流。这条路的好处是可预期:广告主知道怎么买,代理商知道怎么卖,监测方知道怎么算。

代价是:用户会立刻感知到"这是广告"。中文社区里有一条 730 赞的评论早就预判了这件事,用词是"AI 百度化""谁给的钱多推谁"。

5.2 豆包、通义:接电商,不接广告

国内头部大模型选的是另一条路:打通交易链路。豆包与通义千问在做的是把 AI 对话接到电商与本地生活的既有体系里。

这条路的商业模式其实是平台原有的电商抽佣,AI 只是新的入口。好处是变现路径现成、跑得通;副作用是它优化的是成交,不是回答质量——当一个提问既可以给出中立的比较,也可以引导到店铺时,激励是明确的。

对品牌方的含义:在这些平台上,"被推荐"和"被交易链路选中"会逐渐变成两件事,前者可能仍然免费,后者会有价格。

5.3 DeepSeek:什么都不做

DeepSeek 到目前为止几乎没有任何商业化动作。它的回答里既没有广告标识,也没有可见的商业排序。

这意味着一件对甲方非常实际的事:在这个平台上,内容质量与信源结构几乎是决定被引用与否的全部因素。

需要补充一个技术事实:DeepSeek 不自建搜索索引,联网检索时调用的是外部搜索引擎的结果。 这条链路决定了优化的优先级——如果内容没有被上游搜索引擎收录,在需要联网的场景下 DeepSeek 根本看不到。

5.4 三种姿态对甲方的不同含义

平台

商业化姿态

对品牌的含义

OpenAI

广告位搬进对话

迟早要为位置付费;现在的自然引用是限时红利

豆包 / 通义

打通交易链路

"被推荐"与"被交易选中"会分化,后者要花钱

DeepSeek

基本不商业化

内容与信源质量几乎决定一切,是当前性价比最高的阵地

这张表的实际用途是分配资源。 如果预算有限,优先级应该看你的客户在哪个平台,而不是哪个平台名气大。

六、社区在讨论什么:一个被误读的分布

我们采集了中文社区的甲方原声,按购买旅程分类,结果是这样的:

阶段

条数

① 还没买 · 不知道是什么

84

② 还没买 · 不知道找谁

151

③ 还没买 · 不知道多少钱

111

④ 还没买 · 怀疑是不是骗局

48

⑤ 买了 · 没有效果

9

⑥ 买了 · 不知道怎么验收

24

⑦ 规则变了 · 我被影响了

15

⑧ 同行都在做 · 我怎么办

29

⑨ 消费者 · 我还信不信 AI

46

394 条集中在"还没买"阶段,而"买了之后"的问题只有 48 条。

6.1 一个必须先说的采样偏差

这批数据用 155 个关键词采集,其中 64 个直接含 GEO / AI搜索 / 豆包 等术语,其余 91 个大多是营销 KOL 与媒体名。真正能触达"不知道 GEO 是什么的甲方"的词不到 10 个。

结果是:1,938 个账号里,内容号占 69.1%、供给侧占 15.8%,真实用户求助仅 41 个(2.1%)

所以这批数据回答"乙方在说什么"是有效的,不能当成"市场在说什么"。 甲方不谈 GEO,甲方谈自己的生意——他们进入这个数据集的唯一路径,是偶然刷到服务商视频并留言。

理解这个偏差之后,上面那张表的正确读法是:在"会主动讨论 GEO 的人群"里,绝大多数还没完成购买决策。

6.2 "买了没效果只有 9 条"是个陷阱

直觉上会认为:只有 9 条抱怨没效果,说明效果还行。

这个推论不成立,原因在下一节的语言学证据里。

七、一个语言学发现:中文里没有"验收"这个词

我们同时持有中文与英文两套语料,做了一次词频对照。结果指向四个结构性差异。

7.1 「有没有效果」1,481 次,attribution 75 次

中文

英文

有没有效果(1,481 次

attribution(75 次,且英文语料规模小得多)

"有没有效果"是一道是非题,attribution 是一道分配问题。

这个差别决定了甲方能不能向老板交代。回答"有效果"只能靠感觉;回答"这部分增长中有多少来自 AI 渠道"才能进预算表。

7.2 「验收」在中文语料只出现 14 次

中文

英文

验收(14 次

decision-grade(17)+ reproducibility(14)+ benchmark(23)——都是 IAB 标准的核心章节

不是需求不存在,是词不存在。没有词,需求就说不出来。

这重新解释了上一节那个"买了不知道怎么验收仅 24 条"——不是不需要验收,是没有语言去表达这个需求。 甲方能说出口的只有"有没有效果",而这句话得不到有用的答案。

7.3 中文有「投毒」201 次,英文有 hallucination

中文

英文

AI 投毒 / 投毒(201 次

hallucination(IAB 标准专设 *Hallucination & Factual Inaccuracy Detection* 一节);中文"幻觉"仅 18 次

"投毒"预设有人故意干;"hallucination"预设模型自己出错。

讲投毒是讲对抗,讲幻觉是讲治理。立场完全不同。

前者导向"我要抢在对手前面",后者导向"我要建立事实核查机制"。同样是发现 AI 说错了自己的信息,两种框架会推导出完全不同的行动。

7.4 中文说「信源/收录」,英文说 retrieval/ingestion

中文

英文

信源(246)/ 收录(224)

retrieval(49)/ ingestion(4)/ citation rate(12)

主客体是反的。

中文的"信源""收录"来自媒体投放与 SEO 时代,暗示"我去把内容铺过去";英文的 retrieval、ingestion 来自信息检索领域,暗示"系统来把内容取过去"

一个是推,一个是拉。这决定了工作方式:推的思路会导向铺量,拉的思路会导向让内容更容易被取。

八、行业组织在做什么:标准正在成形

8.1 IAB 的第一份 AI 可见性度量标准

《Measuring Visibility in the AI Era》,IAB 发布,2026 年 8 月 3 日,状态 Final,约 35 页,由 IAB 的 AI 副总裁 Caroline Giegerich 牵头。

工作组成员来自:Walmart(Sr Director, Measurement Science)、EMARKETER(Sr. Director, AI Visibility and Measurement)、Acxiom(Chief Innovation Officer)、WPP Media、Microsoft Clarity(两位)、PMG 等。

注意这个名单的构成:既有甲方(Walmart)、又有代理商(WPP Media、PMG)、又有平台(Microsoft)、还有数据方(Acxiom、EMARKETER)。这是标准制定的典型阵容,不是某一方的自说自话。

为什么这件事重要:在广告业的历史里,度量口径统一之后,计价方式通常就不远了——可计量是可交易的前提。CPM 能成为结算单位,前提是第三方监测能算清曝光;CPC 能成立,前提是点击可被验证。

所以这份文件真正的信号是:行业正在把"AI 可见性"从一个模糊概念,变成一个可以被第三方核验的指标。

8.2 WFA:从战术转向协调

世界广告主联盟(纯甲方组织)在报告里给出的建议顺序值得注意:

  1. 建立跨职能治理模型
  2. 定义品牌信息的 source-of-truth
  3. 监测 AI 生成的输出
  4. 为不准确的呈现建立升级处理流程
  5. 从战术性的 GEO 讨论,转向协调一致的可见性方法

第 5 条是对第 1–4 条的总结,也是对当下市场的直接批评。 "战术性的 GEO 讨论"指的就是当下大量存在的技巧层面的讨论;WFA 的建议是把它上升成治理问题。

第 2 条"定义品牌信息的 source-of-truth"值得单独强调——它承认了一件事:品牌自己往往说不清哪份材料是权威版本。 官网、公众号、百科、电商详情页各说各的,AI 自然会给出不一致的答案。

8.3 一个反面证据:没有人公开复盘过

我们做了专门的检索,记录"没找到什么"和"找到什么"同样重要:

  • 品牌方公开的 GEO 完整复盘:零。 企业在招人、设岗、花钱,但没有一家公开讲过完整的过程和数据
  • 2026 年 8 月国内的品牌方第一方内容:零。 国内该月的检索结果 100% 为服务商软文(来自多家媒体渠道,但共用同一套"推荐榜"模板)。
  • 四条最有价值的信息通道(Reddit、LinkedIn、招聘平台、YouTube)全部需要登录才能访问

最后一条指向一个结构性结论:公开可搜的内容已经被服务商占满,真实的讨论都在需要身份验证的地方。

这本身就是当前阶段的特征——一个信息极度不对称的市场:卖方声音饱和,买方声音稀缺。

补充一:这轮变化更像哪一次

把生成式引擎的冲击放进三十年的坐标里,它跟历史上三次转折都有相似之处,但都不完全一样。

像 2000 年代初的搜索崛起,但用户不再点击

搜索取代门户导航时,流量从"编辑推荐"转向"用户主动查询",品牌方要做的事从"买版位"变成"被搜到"。这一次同样是入口转移。

关键差异在点击。 搜索时代的核心资产是排名,因为排名带来点击,点击带来落地页,落地页带来转化——链路是连续的。而 AI 回答里没有"排名"这回事,只有"被提到"和"没被提到";而且大量提问在得到答案后就结束了,链路是断的。

这意味着 SEO 时代那套"排名 → 展现 → 点击 → 流量 → 转化"的指标链条,在这里前半段还在,后半段断了。

像 2010 年代的程序化,但没有第三方监测

程序化广告出现时,广告主同样面临"钱花在哪不知道"的黑箱问题。解决路径是:第三方监测机构出现 → 曝光可被独立核验 → 计价方式稳定 → 产业链成型。

这一次的第三方监测角色目前是空缺的。 平台自己的数据是唯一来源,而平台既是运动员又是裁判员。IAB 的标准是往这个方向走的第一步,但离真正的第三方核验还有距离。

对甲方的实际含义:在第三方核验出现之前,任何服务商声称的效果数据都缺乏独立验证渠道。这也解释了为什么海外从业者的骂点集中在"你凭什么说你测得准"。

像 MarTech 的工具化,但没有明确的 owner

CDP、SCRM 进入企业时,也曾面临"这归谁管"的问题——是 IT 还是市场?最终大多沉淀为市场部持有、IT 支持的模式。

这一次的归属更混乱。WFA 的数据显示 43% 的品牌把 AI 可见性的归属分散在多个团队共担。而分散共担在组织现实里通常意味着没有人真正负责,也没有独立预算。

没有 owner 的后果不是没人做,是做了没人认。 这正是"不知道怎么验收"的组织根源——不是技术上验收不了,是没有一个岗位需要为这个数字负责。

补充二:甲方内部落地的三个卡点

结合上市公司披露、CMO Survey、WFA 报告与社区原声,甲方在内部推动这件事时反复卡在三个地方。

卡点一:预算从哪出

GEO 在 CMO Survey 中的采用率是 41.5%,但它在多数企业里不是一个独立预算项。实际做法通常是从内容预算或 SEO 预算里挪。

这带来一个结构性矛盾:内容预算按产出量考核(发了多少篇),SEO 预算按排名与流量考核,而 GEO 的产出既不是篇数也不是排名。 挪用哪一个预算,就会被哪一套指标考核,然后必然显得"效果不好"。

可行的做法是把它当作品牌资产投入而非获客投入来立项——参照的是内容资产或知识库建设,而不是投放。

卡点二:向上汇报时说不清

这一条与前面的语言学发现直接对应。当 CMO 问"效果怎么样",能拿出的往往只有"我们在 AI 里被提到了",而这句话无法进预算表。

需要的是把"被提到"拆成可比较的量:在固定的一组问题上,被提及的比例是多少、和上季度比如何、和主要竞品比如何、AI 引用的来源里有多少是我们能影响的。这四个数字合起来,才构成一次能向上汇报的说明。

注意这四个数字都不涉及流量。 在当前阶段用流量向上汇报,等于主动把自己放在必输的位置。

卡点三:内容归谁改

WFA 建议里的"定义品牌信息的 source-of-truth",在执行层面是最难的一条。

企业的品牌信息通常分散在官网、公众号、电商详情页、百科词条、经销商页面、历史新闻稿里,分属不同部门、不同时期、不同外包商。当 AI 给出的答案里出现过时或错误的信息,第一个问题往往不是"怎么改",而是"这句话是哪来的、谁能改"。

这件事没有捷径,但有一个成本较低的起点:先做一次全渠道的品牌信息盘点,把冲突项列出来。冲突项本身就是 AI 出错的高发区。

补充三:三条被反复误读的数据

行业讨论里有几个数字被高频引用,但引用时普遍丢掉了前提。这里逐条说明,甲方在评估服务商时可以直接拿来核对。

「91% 的品牌引用只出现在单一 AI 平台」

这条出自 Kevin Indig 的 AI Halftime Report H1 2026。正确的读法是:单平台监测必然给出错误结论。

如果你只测豆包,看到品牌提及率不错就下结论"我们做得挺好",那么在 DeepSeek 或元宝上的缺席你完全看不见。反过来,只在一个平台上看不到自己,也不代表全面缺席。

这条数据的实际用途是:任何只覆盖单一平台的监测报价,都应该被追问其余平台怎么办。

需要说明该报告的局限:这主要是 Growth Memo 的自有研究,样本量与方法未在文中完整披露。 引用时应当标注这一点。

「用户直接接受 AI 推荐、不再验证的比例达 88%」

同一份报告。这条经常被用来论证"AI 推荐的价值极高",方向没错,但它同时意味着风险对称放大——如果 AI 说错了你的信息,88% 的人也不会去验证。

所以事实纠正的优先级,应当和可见度提升同等。 这正是 IAB 标准里专设 Hallucination & Factual Inaccuracy Detection 一节的原因,也是中文语境里"投毒"这个框架容易忽略的部分:你担心对手做手脚的同时,模型自己出错的概率可能更高。

「92.8% 的购物任务全程无对外点击」

出自同一研究者的购物行为研究,样本是 56 人、221 次 ChatGPT 购物任务。同一研究还给出:入选品牌与落选品牌的 share of voice 分别是 24% 与 11%

样本量不大,引用时应当如实说明。 但它指向的方向与上市公司财报是一致的——People Inc 的 Core Sessions 下降 22%、LegalZoom 明确写"零点击导致获客成本上升"。

多个独立来源指向同一方向,比单一来源的大样本更值得相信。 这也是本文尽量交叉引用一手材料的原因。

一个通用的核对方法

面对任何 GEO 相关的数字,问四个问题:

  1. 谁测的? 是平台自报、服务商自报,还是第三方?
  2. 测的是什么? 可见性、流量,还是营收?三者差别极大。
  3. 样本多大、什么时间? 56 人和 5,600 人的结论强度不同。
  4. 有没有"up to"这类限定被掐掉? 「最高提升 40%」和「平均提升 40%」是两回事。

这四个问题能筛掉市面上大部分不可用的数字。

补充四:IAB 标准到底定义了什么

前面提到 IAB 在 2026 年 8 月 3 日发布了《Measuring Visibility in the AI Era》。这一节把它的核心内容拆开——因为它大概率会成为下一阶段甲方采购时的问题清单

它对市场现状的判断

文件里有一段直接的诊断:

"More than 20 companies now sell AI visibility tools, each using different methodologies and producing different answers for the same brand or publisher. Buyers have budgets ready to spend. They have no basis for evaluating what they are buying." >—— IAB《Measuring Visibility in the AI Era》,2026-08-03

翻译过来:20 多家公司在卖 AI 可见性工具,各用各的方法,对同一个品牌给出不同答案。买方预算已经准备好了,但他们没有依据判断自己买的是什么。

这句话由行业组织写出来,比任何第三方评论都有分量。它也解释了海外从业者社区里那种敌意——骂点不是"这件事没意义",而是"你凭什么说你测得准"

同一份文件还给出了规模判断:

"ChatGPT has more than 900 million weekly active users and Google AI Overviews have over 2.5 billion monthly users."

周活 9 亿、月活 25 亿——这是标准制定者认定"变化已不再是推测"的依据。

核心框架:4P

IAB 把品牌侧的 AI 可见性指标组织成一个因果层级,称为 4P:

层级

含义

具体指标

Presence(在场)

有没有出现

Mention Rate(提及率)、Citation Rate(引用率)、Share of Voice(声量占比)、Visibility Momentum(可见度动量)

Prominence(显著度)

出现在什么位置

Position(位置)

Portrayal(呈现方式)

被怎么描述

Sentiment(情感)、Framing(框架)、Hallucination Rate(幻觉率)Factual Inaccuracy Rate(事实错误率)

Persuasion(说服力)

有没有推动决策

Recommendation Strength(推荐强度)、Post-Citation CTR(引用后点击率)

这个层级是有因果顺序的:先要在场,才谈得上位置;有了位置,才谈得上被怎么描述;被正确描述了,才谈得上说服力。

对甲方最有用的是第三层。 Portrayal 里专门设了 Hallucination Rate 和 Factual Inaccuracy Rate 两个指标——这意味着"AI 有没有说错我的信息"被正式列为一个需要持续测量的指标,而不是偶发事故。

对照前面那个语言学发现:中文语境里对应的词是"投毒"(201 次),预设有人故意干;而 IAB 的框架预设的是模型自己出错,需要建立检测机制。框架不同,行动就不同。

关键区分:Directional vs Decision-Grade

这是整份文件里最实用的部分。IAB 把 AI 可见性数据分成两档:


Directional(方向性)

Decision-Grade(决策级)

主要用途

识别模式与趋势信号

支撑高风险的业务动作

适用场景

早期信号发现、内部认知、竞争态势感知

预算重新分配、代理商 brief、绩效考核、高管战略

严谨度

深度不足

在样本量、查询量、提问类型覆盖、测试频率、可复现性、数据校验、方法学文档、平台覆盖(含多平台聚合)等方面达到更高标准

明确限制

不足以支撑预算分配或战略决策

——

文件里有一句判断值得原样引用:

"Both serve legitimate purposes; the failure is in treating directional data as decision-grade without recognizing the gap."

两者都有正当用途;失败在于把方向性数据当成决策级数据来用,却没意识到中间的差距。

这句话是给甲方的。当服务商拿出一份报告说"你的提及率是 X%",第一个该问的问题不是这个数字好不好,而是:这是 directional 还是 decision-grade?

判断依据文件里也给了——样本量、查询量、提问类型覆盖、测试频率、可复现性、数据校验、方法学文档、平台覆盖。八项里有一项说不清楚,就只能算 directional。

供应商披露框架

IAB 还专门设了一章:Provider Disclosure Framework: What Should Providers Disclose?(第 26 页)

其逻辑是文件自己写明的:

"Quality tiers are only useful if buyers can verify them."

质量分级只有在买方能够核验时才有意义。 所以文件定义了服务商必须披露哪些信息,让买方自己判断——包括平台覆盖范围等。

这一章是这份标准里最具操作性的部分,也是甲方最应该拿来当采购清单用的部分。

还有一章讲稳定性

Measurement Stability and Reproducibility: How to Get the Most Consistent Results?(第 31 页)

这一章的存在本身就说明了一件事:AI 回答天然不稳定,同一个问题在不同时间问会得到不同答案。 所以"如何得到最一致的结果"需要专门用一章来讲方法。

这对甲方的含义是:如果一份监测报告的数字每次都剧烈波动,问题可能不在你的内容,而在测量方法没有做稳定性控制。反过来,如果一份报告的数字过于平滑,也值得怀疑——真实的 AI 回答不会那么稳。

补充五:谁在财报里写下了这个词

前面提到 SEC 全文检索命中 60 家公司,其中 30 家明确提到 GEO 或 AEO。这一节把这 30 家的时间线摊开——因为财报里的用词变化,是判断一个概念是否进入主流的最保守指标。

首次提及的时间线

时间

公司

文件类型

触发词

2025-03-24

Intelligent Protection Management

10-K

generative engine optimization

2025-08-22

Onfolio Holdings

S-1

generative engine optimization + AI Overviews

2025-09-03

Intuit

10-K

generative engine optimization

2025-09-05

Glidelogic

10-Q

generative engine optimization

2025-11-05

HubSpot

10-Q

answer engine optimization

2025-11-12

Wix.com

EX-99.1

generative engine optimization

2025-11-19

SEMrush

DEFA14A

generative engine optimization

2025-12-10

Atlantic Union Bankshares

EX-99.1

GEO + AI Overviews

2026-01-15

Adobe

10-K

generative engine optimization

2026-02-25

Zeta Global / Fastly

10-K

generative engine optimization

2026-02-27

Primerica

10-K

generative engine optimization

2026-03-02

Similarweb

20-F

answer engine optimization

2026-03-11

TechTarget

10-K

generative engine optimization

2026-03-12

Fiverr

20-F

generative engine optimization

2026-03-16

Stagwell

ARS

generative engine optimization

2026-03-20

Duluth Holdings

10-K

answer engine optimization

2026-04-14

Rent the Runway

EX-99.1

AEO + AI-powered discovery

2026-06-17

Tailored Brands

DRS/A

AEO + agentic shopping

2026-07-17

Destination XL Group

PREM14A

generative engine optimization

2026-08-12

Direct Digital Holdings

EX-99.1

generative engine optimization

(完整名单 30 家,此处列出有代表性的 20 家)

按季度看首次提及的公司数

季度

首次提及的公司数

2025 Q1

1

2025 Q3

3

2025 Q4

5

2026 Q1

11

2026 Q2

5

2026 Q3(截至 8/20)

5

2026 年第一季度是拐点——11 家公司在同一个季度首次把这个词写进受法律约束的文件。

这里必须标注一个方法学限制:季度曲线会受财报季影响(10-K 集中在 Q1,年报与委托书集中在 Q2),所以不能直接读作"增长速度"。更可靠的读法是"首次提到的公司数"这个累计计数——它只会增加,不会因为财报季波动。而这个累计数从 2025 年初的 1 家到 2026 年 8 月的 30 家。

名单本身说明了三件事

第一,这不再是营销圈的自嗨。 Intuit(财税软件)、Primerica(保险)、Atlantic Union Bankshares(银行)、Duluth Holdings(服装零售)、Rent the Runway(时装租赁)、Tailored Brands(男装)——这些都不是科技媒体或营销服务商,是各行各业的实体经营者。

第二,工具厂商在集体转向。 SEMrush、Similarweb、Yext、TechTarget、Stagwell——老牌 SEO 与数字营销工具方全部在财报里提到了这个词。

第三,出现了行业整合。 SEMrush 在 2025 年 11 月 19 日提交的 DEFA14A 中,披露了与 Adobe 的合并安排——SEMrush 将作为 Adobe 的全资子公司存续。而 Adobe 自己在 2026 年 1 月 15 日的 10-K 里也提到了 generative engine optimization。

一家老牌 SEO 工具厂商被内容与体验软件巨头收购,这是品类走向成熟的典型信号:从独立工具变成大平台的一个能力模块。

一个必要的提醒

"在财报里提到"不等于"做得好"。财报提及可能出于三种完全不同的动机:

  1. 风险披露 —— 承认 AI 搜索正在冲击自己的流量(TripAdvisor、Yelp、LegalZoom 属于这类)
  2. 战略陈述 —— 宣布自己要做这个方向(Adobe、Stagwell 属于这类)
  3. 业务描述 —— 说明自己的产品包含这个能力(SEMrush、Similarweb、Yext 属于这类)

读这份名单时要区分这三类,否则会得出"大家都在做 GEO"的错误结论。 实际情况更接近:有人在挨打,有人在卖铲子,有人在观望。

补充六:学术脉络与「40%」的完整出处

市面上的 GEO 话术几乎都能追溯到少数几篇论文。理清这条脉络,有助于判断哪些说法有依据、哪些是层层转述后的变形。

起点不是 GEO,是「可验证性」

2023 年 4 月,斯坦福的 Nelson F. Liu、Tianyi Zhang、Percy Liang 发表《Evaluating Verifiability in Generative Search Engines》(EMNLP,arXiv:2304.09848,被引 428 次)。

论文的出发点是:生成式搜索引擎直接生成答案并附带行内引用,而"可验证性"是可信任的前提——系统应当让用户能核查每一句话的来源。

注意这个起点:最早的学术关切是"能不能核查",不是"怎么优化"。

GEO 这个词的诞生

2023 年 11 月 16 日,Pranjal Aggarwal、Vishvak Murahari、Tanmay Rajpurohit、Ashwin Kalyan、Karthik Narasimhan、Ameet Deshpande 提交《GEO: Generative Engine Optimization》(arXiv:2311.09735,后发表于 KDD 2024)。

这篇论文做了两件事:提出 GEO 这个概念,并建立了 GEO-bench 基准集。

「提升 40%」的三个前提

论文中的原始表述是:

"GEO can boost visibility by up to 40% in generative engine responses."

而市面上流传的版本通常是"GEO 能提升 40% 的曝光"。三个前提在传播中被系统性地掐掉了:

原文

流传版本

差别

up to 40%

提升 40%

"最高可达"变成了"平均可以"

在自建的 GEO-bench 上测得

(不提)

基准集不等于真实流量环境

提升的是 visibility(生成回答中的可见性)

提升曝光/流量/业绩

可见性 ≠ 流量 ≠ 营收

如果一家服务商引用"40%"时不说明这三条,可以直接判断它没读过原文。

一个更重要的错位:论文的立场是防御性的

这篇论文的写作动机,与国内市场对 GEO 的使用方式是相反的。

原文中作者明确写道,他们关切的是内容创作者在生成式引擎面前的弱势地位——"we must ensure the creator economy is not disadvantaged"(我们必须确保创作者经济不被置于不利地位),针对的是生成引擎的黑箱不可控

论文是在为内容方争取权益,而市面上卖的 GEO 是"把同行挤下去"。

同一个词,两个相反的框架。 这个错位值得每一个做这门生意的人知道——不是说进攻性的用法不合法,而是当你引用这篇论文为自己背书时,你引用的是一篇立场与你相反的文献。

学术与产业的时间差

把三条时间线并排:

时间

学术

产业

标准

2023-04

可验证性研究

2023-11

GEO 概念提出

2024

KDD 2024 收录

2025-03

首家公司写进 SEC 文件

2025-11

SEMrush 被 Adobe 收购安排

2026-01

11 家公司同季度首次提及

2026-06

WFA 报告

2026-08

IAB 度量标准 Final

从概念提出到行业标准,用了两年九个月。 作为参照,搜索引擎优化从概念出现到行业实践规范化,用了数年时间。

这条时间线的实际用途:判断当前处在哪个阶段。标准刚出,采纳率还看不出来——这意味着现在仍是规则未定的阶段,也意味着现在建立的方法论有机会成为默认做法。

补充七:从 12 份 JD 原文看这个岗位到底要做什么

招聘 JD 是判断一件事是否真实落地的最保守指标——白皮书可以写、案例可以编,但 HC 要走审批、要进组织架构、要发真工资。

我们通过 Greenhouse 与 Lever 的公开 ATS 接口(无需登录)取到 12 份 GEO/AEO 岗位的 JD 全文

谁在招

公司

职位

地点

Stripe

AEO and GEO Marketing Manager

美国远程

Stripe

Head of AEO & SEO

美国远程 / 芝加哥 / 亚特兰大 / 加拿大

Databricks

Director, Agent & AI Search

美国

Databricks

Staff Software Engineer, AI Search

山景城

Instacart

Software Engineer II, Technical Search Visibility

加拿大远程

Calendly

Director, Brand Influence, Advocacy & AI Discovery

美国远程

Asana

Head of SEO & AEO

旧金山

MongoDB

Answer Engine Optimization (AEO) Lead

美国

Datadog

Senior Director, Growth Marketing – Organic Growth (SEO/GEO/PLG)

旧金山

Brex

Director, Organic Growth & Discoverability

西雅图 / 纽约 / 旧金山(三地同岗)

三个值得注意的地方:

第一,职级普遍偏高。 Head of、Director、Senior Director、Staff Engineer——这不是招执行岗,是招负责人和资深工程师。Asana 的 Head of SEO & AEO 薪资区间是 $218K–$256K

第二,Brex 在三个城市同时开同一个岗位,这通常意味着这不是试水,是确定要招到人。

第三,出现了工程岗。 Databricks 的 Staff Software Engineer, AI Search 和 Instacart 的 Software Engineer II, Technical Search Visibility——这说明在部分公司里,这件事已经不只是市场部的活,而是需要工程投入的系统问题。

JD 全文里的高频要求

对 12 份 JD 全文做词频统计(部分关键词):

关键词

出现次数

说明

AEO

37

海外更常用 AEO 而非 GEO

experiment(实验)

22

高频出现,说明这是个需要做对照实验的岗位

LLM

22


citation(引用)

14

核心指标是"被引用"

SQL

13

要能自己查数

technical SEO

13

技术 SEO 基本功仍是前提

schema(结构化标记)

13


API

11


cross-functional(跨职能)

11

对应 WFA 说的"归属分散"

ChatGPT

10


Perplexity

8


structured data

8


measurement(度量)

8


share of voice(声量占比)

7

与 IAB 的 Presence 层指标一致

content strategy

7


attribution(归因)

4


这份词频说明了什么

① 海外的术语是 AEO 不是 GEO。 AEO 出现 37 次、GEO 17 次。这与国内几乎只说 GEO 形成对比——如果你做出海业务,用错词会直接影响被检索到的概率。

② 这是一个要做实验、要会查数的岗位。 experiment 22 次、SQL 13 次。它不是"写更多文章"的岗位,是"设计对照、验证假设、自己拉数据"的岗位。

对照前面那个语言学发现:中文语境里对应的岗位描述往往是"负责内容优化与发布",而海外 JD 要求的是实验设计与数据分析能力。这个差别决定了两边产出的东西不在一个层级。

③ technical SEO 仍然是前提。 13 次提及,与 schema 并列。没有一家公司认为 AEO 可以脱离技术 SEO 基础独立存在。

④ 指标语言与 IAB 标准一致。 citation(14)、share of voice(7)、attribution(4)、measurement(8)——这些词正是 IAB 4P 框架里的指标名。说明标准与实践正在互相塑造。

一个必须标注的采样偏差

我们探测的公司 token 清单以美国科技 / SaaS 公司为主,零售、消费、金融品牌覆盖不足。

所以"GEO 岗集中在 B2B SaaS"这个观感是采样造成的,不能当结论。 SEC 那批数据显示 Duluth Holdings(服装零售)、Rent the Runway(时装租赁)、Tailored Brands(男装)也在做,只是这些公司多用 Workday 或 iCIMS 作为招聘系统,不在本次接口覆盖范围内。

另外,本批 JD 只有 updated_at(全部落在 2026-08-17 至 20,是列表刷新时间不是发布时间),拿不到发布曲线。招聘网站的发布时间会被反复刷新,用它画趋势必然是假的。

补充八:CMO Survey 完整 18 项——GEO 的真实位置

前面提到 GEO 在 The CMO Survey 中的采用率是 41.5%、排第 8。把完整的 18 项排名摊开,能看到更准确的位置。

问题原文:How is your company using AI in its marketing activities? (check all that apply) n=188

排名

用途

采用率

1

Content creation(内容生产)

73.9%

2

Content personalization(内容个性化)

65.4%

3

Improving marketing ROI by optimizing content and timing

49.5%

4

Marketing automation(营销自动化)

48.9%

5

Data analysis and reporting(数据分析与报告)

46.3%

6

Targeting decisions(定向决策)

45.2%

7

Predictive analytics for customer insights

41.5%

8

GEO(生成式引擎优化)

41.5%

9

Conversational AI for customer service

39.9%

10

Customer segmentation(客户分层)

35.6%

11

Programmatic advertising and media buying(程序化广告)

32.4%

12

Listening and sentiment analysis(舆情与情感分析)

28.2%

13

Next best offer

12.8%

14

Autonomous objects/systems

9.6%

15

Augmented and virtual reality(AR/VR)

6.4%

16

Voice search optimization(语音搜索优化)

4.3%

17

Facial recognition and visual search

3.7%

18

Biometrics(生物识别)

1.1%

三个对比值得注意

① GEO(41.5%)已经超过程序化广告(32.4%)。

程序化是一个发展了十余年、有成熟产业链和结算标准的领域;GEO 是一个 2023 年底才被命名的概念。在 VP 级样本里,后者的采用率已经反超前者。

需要谨慎解读:这里的"采用"是自报的"在营销中使用",门槛远低于"建立了完整体系"。结合 WFA 那组数据看更准确——96% 认为有重大影响,但只有 6% 建立了明确的策略、归属与度量框架。

② GEO(41.5%)远高于语音搜索优化(4.3%),差了近 10 倍。

这个对比很有意思。语音搜索(Siri、Alexa)在 2017–2019 年间也曾被广泛预测为"下一个入口",当时"语音搜索优化"是行业热词。七八年后的今天,它在 CMO 的实际使用清单里只有 4.3%。

这是一个有用的参照系:不是所有被预测为"下一个入口"的东西都会兑现。GEO 目前的 41.5% 说明它的兑现程度已远超语音搜索,但这不构成"它一定会继续兑现"的保证

③ 排在 GEO 前面的七项,基本都是"用 AI 提效",而 GEO 是"被 AI 影响"。

内容生产、个性化、自动化、数据分析——这些是把 AI 当工具用。而 GEO 是应对 AI 改变了用户找信息的方式,方向是反的。

WFA 的一组数据可以印证:其会员中 70% 优先把生成式 AI 用于提效(自动化)而非提升效果;创意侧 78% 已在对外营销创意中使用 AI,其中产品图 87%、营销文案 80%、背景视觉 77%。

也就是说,大多数企业对 AI 的使用仍停留在"降本提效",而"AI 改变了获客链路"这件事的应对,才刚开始。

这份调查为什么可信

三点值得说明:

  1. 非商业性质。主持方是 Duke University Fuqua 商学院,赞助方是 Deloitte 与美国营销协会,不是任何 GEO 服务商的委托调研
  2. 样本层级高。308 位应答者中 97% 是 VP 及以上——回答的是有预算决策权的人。
  3. 方法透明。2,111 位受邀、308 人应答、应答率 14.6%、调研期 2026-01-07 至 01-29,全部公开披露。

对照本文引用的其他数据源:Kevin Indig 的研究"样本量与方法未在文中完整披露",WFA 报告的合作方是代理商。同样是数据,可信度分层是不同的,引用时应当说明。

补充九:两边的买家,说着同一件事的两种说法

本文反复提到中英话语差异。这一节把两边的原话并排放,因为同一个困境用两种语言说出来,暴露的问题层级完全不同

同一个困境,两种表达

英文侧(r/SaaS,帖子标题:Watching my organic traffic tank because of AI Overviews and honestly I'm lost):

"it feels like such a black box… I'm really just guessing at this point. Sometimes we show up in the AI snippet, sometimes we don't, and I can't find a consistent pattern yet… Curious if anyone is actually tracking 'LLM mentions' or if we're all just flying blind right now."

中文侧对应的表达是:"豆包一改算法做的都白做了吗"、"怎么知道有没有效果"。

两边说的是同一件事,但英文那句里有三个中文那句没有的东西:

  1. "consistent pattern"(一致的规律) —— 他在找规律,不是在问有没有用
  2. "tracking 'LLM mentions'"(追踪 LLM 提及) —— 他已经知道该测什么指标
  3. "flying blind"(盲飞) —— 他把问题定义为"缺少仪表",不是"这东西不靠谱"

中文那句"怎么知道有没有效果",得不到有用的答案——因为它是个是非题。而"有没有一致的规律""大家在追踪 LLM 提及吗",是能被回答、能被验证、能形成方法的问题。

这就是"词不存在,需求就说不出来"的具体样子。

四组结构性差异的完整对照

维度

中文语料

英文语料

差异的实质

效果 / 归因

有没有效果(1,481 次

attribution(75 次,语料规模小得多)

是非题 vs 分配问题。前者只能回答"有/没有",后者能进预算表

验收 / 决策级

验收(14 次

decision-grade(17)+ reproducibility(14)+ benchmark(23),均为 IAB 标准的核心章节

不是需求不存在,是词不存在

投毒 / 幻觉

AI 投毒 / 投毒(201 次);幻觉仅 18 次

hallucination(IAB 专设 *Hallucination & Factual Inaccuracy Detection* 一节)

投毒预设有人故意干,hallucination 预设模型自己错。讲对抗 vs 讲治理

信源 / 检索

信源(246)/ 收录(224)

retrieval(49)/ ingestion(4)/ citation rate(12)

主客体是反的。中文暗示"我去铺过去",英文暗示"系统来取过去"

为什么"投毒"这个框架有实际代价

这一组值得展开,因为它直接影响资源分配。

"投毒"框架导向的行动是:盯竞争对手、抢占信源、担心被人做手脚。资源投向"比对手更快更多地铺内容"。

"hallucination"框架导向的行动是:建立事实核查机制、定义品牌信息的 source-of-truth、为错误呈现设置升级处理流程。资源投向"确保关于我的信息是对的"。

哪个更重要? 有一组数据可以参考:Kevin Indig 的研究显示,88% 的用户直接接受 AI 推荐、不再验证(该研究样本量与方法未完整披露,引用时应注明)。

如果 88% 的人不会去核实,那么当 AI 说错你的产品参数、价格、资质时,错误会被直接采信。这个损失不需要任何竞争对手动手就会发生。

而 IAB 把 Hallucination Rate 和 Factual Inaccuracy Rate 列为 Portrayal 层的正式指标,说明标准制定者认为这是需要持续测量的常态问题,不是偶发事故。

对照 WFA 给品牌的五条建议,其中两条直接对应这件事:"定义品牌信息的 source-of-truth""为不准确的呈现建立升级处理流程"

结论是:在"投毒"框架下容易被忽略的事实治理,可能才是当前更高优先级的工作。

中文买家的真实旅程分布

回到那组分类数据。394 条集中在"还没买",48 条在"买了之后"。

在充分理解采样偏差的前提下(这批数据回答"乙方在说什么"有效,不能当成"市场在说什么"),有一个读法是成立的:

在会主动讨论 GEO 的人群里,绝大多数还没完成购买决策,而且卡点依次是"不知道找谁"(151)、"不知道多少钱"(111)、"不知道是什么"(84)、"怀疑是不是骗局"(48)。

前两个卡点是信息不对称问题,不是认知问题。 不知道找谁、不知道多少钱——这两件事本该由公开的价格与能力对照来解决,但市场上没有。这也解释了为什么"怀疑是不是骗局"会有 48 条:当价格与能力都不透明时,怀疑是理性反应。

一个必须承认的对称事实

我们此前默认"国内骗局多是中国市场鱼龙混杂的特殊问题,海外更成熟"。数据不支持这个预设。

Reddit 上从业者对 GEO 的主流态度是敌意,骂点集中在"你凭什么说你测得准"。而且英文侧同样存在软文污染——评赞比最高的几条"买家抱怨帖",作者在评论区自曝在做同类产品,结构与中文的"先坏后好"模板完全同构:真问题开场 → 末尾落到自家产品。

判别方法两边通用:看结论对谁有利。落点是"我做了个东西解决它"的,是软文。

这条修正的含义是:不要指望"参考海外做法"能自动避开国内的问题。海外的问题只是形式更高级。 真正有用的是那套可核验的度量标准,不是"海外经验"这个笼统的东西。

九、往前看:三个可以观察的变量

9.1 计价方式会怎么定下来

有三种可能,目前都还没有明显胜出:

A. 沿用广告位逻辑 —— OpenAI 正在走的路。把对话流当成新的版位,按曝光或点击计价。优点是产业链现成,缺点是用户会感知为广告,长期损耗信任。

B. 走交易抽佣 —— 豆包、通义正在走的路。不为"提及"收费,为"成交"收费。优点是效果明确,缺点是会把 AI 推向导购而非顾问。

C. 为"可见性"本身定价 —— 目前没有平台在做,但 IAB 的度量标准是这条路的前提。如果可见性能被第三方核验,理论上就可以被交易。

对甲方的实际建议:现在不要押注任何一种。三条路对内容的要求是趋同的——结构化、有数据、有出处、跨平台一致。把这部分做扎实,无论最后哪种计价方式胜出都不吃亏。

9.2 度量标准会往哪走

IAB 的标准发布仅 18 天(截至我们采集时),还看不出采纳率。但可以观察两个指标:

  • 是否出现第三方核验机构。就像当年的曝光监测第三方,这个角色一旦出现,市场会迅速规范。
  • 甲方招聘 JD 里是否开始出现标准术语。如果 decision-grade、reproducibility 这类词进入 JD,说明标准在落地。

9.3 国内会不会走出自己的路径

国内有两条线值得分开看:

出海线:像美仪股份这样为海外获客设 GEO 岗的制造业企业,面对的是海外的规则与标准,会更快跟上 IAB 那套度量语言。

本土线:面对豆包、通义、DeepSeek 这三种截然不同的商业化姿态,且缺乏对应的行业组织与标准。目前本土线最大的缺口不是技术,是那个不存在的"验收"词——没有共同的度量语言,甲方无法向内部交代,乙方无法证明价值,市场就只能靠话术竞争。

十、给两方的实际建议

如果你是甲方

  1. 先建立基线,再谈优化。 在没有基线的情况下做的任何优化都无法判断效果。基线的最低要求是:固定一组提问、固定引擎范围、固定采集时间、固定入口(网页端与 APP 端分开)。
  2. 用"提及率"和"引用来源占比"考核,不要用流量。 前者能反映真实变化,后者在当前阶段几乎必然得出"没效果"的结论。
  3. 按行业判断投入方向。 如果你所在行业的企业官网在 AI 被引来源中占比很低,把官网做到极致的天花板也有限,资源应更多放在站外信源。
  4. 现在是低成本窗口期。 被引用暂时不收费,但这个状态由"标准尚未建立"支撑,不是永久的。

如果你是乙方

  1. 海外从业者的骂点是"你凭什么说你测得准",不是"这件事没意义"。 这意味着竞争的焦点正在从"能不能做"转向"数据可不可信"。
  2. "提升 40%"这个数字,最好别再用了。 它的三个前提(up to、自建 benchmark、可见性而非营收)在传播中已经被掐掉,一旦被甲方追问来源会很被动。
  3. IAB 标准值得认真读一遍。 它定义了什么叫 decision-grade,而这大概率会成为下一阶段甲方采购时的问题清单。

补充十:一份可以直接用的采购与自查清单

前面的分析如果只沉淀成一件事,应该是这份清单。它把 IAB 标准、WFA 建议和本文的观察,转成甲方能直接使用的问题。

采购时问服务商的九个问题

关于数据质量(对应 IAB 的 Directional vs Decision-Grade)

  1. 你们的数据是 directional 还是 decision-grade? 依据是什么?
  2. 样本量与查询量是多少? 一个品牌测多少个提问、多久测一次?
  3. 提问类型覆盖了哪些? 只测品牌词,还是也测品类词、比较词、场景词?
  4. 可复现性如何? 同一批问题隔天再测,结果波动范围是多少?

关于覆盖范围

  1. 覆盖哪些引擎? 只有一家还是多家?(91% 的品牌引用只出现在单一平台——单平台监测必然给出片面结论)
  2. 网页端与 APP 端分别测吗? 两者的回答可能不同,而多数工具只测网页端。

关于方法透明度

  1. 方法学文档在哪? 能不能拿到写明采集方式、判定标准的文件?
  2. 数据怎么校验? 有没有人工抽检、抽检比例多少?

关于口径

  1. "提及率"的分母是什么? 是提问总数还是有效回答数?不同分母算出的数字差别很大。

这九个问题里有一半答不上来的,那份报告只能当 directional 用——按 IAB 的定义,它"不足以支撑预算分配或战略决策"。

内部自查的六件事

① 建立基线,固定四个变量

在做任何优化之前先测一次,并固定:提问集(同一批问题长期不变)、引擎范围(各引擎分别记录,不混算)、采集时间(同一时段)、入口(网页端与 APP 端分开)。

没有基线的优化无法判断效果——这是所有后续工作的前提。

② 用四个数字向上汇报,不要用流量

  • 在固定问题集上的被提及比例
  • 与上季度对比的变化
  • 与主要竞品对比的相对位置
  • AI 引用的来源里,有多少是我们能影响的

这四个数字都不涉及流量。 在当前阶段用流量汇报,等于主动把自己放在必输的位置——SparkToro 的研究显示 ChatGPT 只贡献约 0.2% 的引荐流量。

③ 做一次全渠道品牌信息盘点

把官网、公众号、电商详情页、百科词条、经销商页面、历史新闻稿里关于同一件事的表述列出来,找出冲突项

冲突项就是 AI 出错的高发区。 这对应 WFA 建议里的"定义品牌信息的 source-of-truth",也是成本最低、见效最直接的一步。

④ 建立事实错误的处理流程

发现 AI 说错了品牌信息之后,谁负责、多久内响应、怎么修正、怎么验证修正生效——这四个问题要有答案。

对应 WFA 的"为不准确的呈现建立升级处理流程",也对应 IAB Portrayal 层的两个指标。

⑤ 明确 owner

WFA 数据显示 43% 的品牌把归属分散在多个团队共担分散共担在组织现实里通常意味着没有人真正负责,也没有独立预算。

⑥ 按行业判断投入配比

不同行业里企业官网在 AI 被引来源中的占比差异极大。官网占比低的行业,把官网做到极致的天花板也有限,资源应更多放在站外信源经营。

三个不该做的事

不要用"提升 40%"这类数字给自己或客户做承诺。 它的三个前提(up to、自建 benchmark、可见性而非营收)在传播中已被掐掉,一旦被追问来源会很被动。

不要只盯竞争对手。 "投毒"框架容易让人忽略更高频的风险——88% 的用户不会去验证 AI 说的话,模型自己出错造成的损失不需要任何人动手。

不要指望"参考海外做法"能自动避坑。 海外从业者社区对 GEO 的态度同样是敌意,软文污染同样存在,只是形式更高级。真正可迁移的是那套可核验的度量标准,不是"海外经验"这个笼统概念。

最后一句

这份报告梳理了三十年计价方式的演进,落点其实很简单:

在计价方式尚未确立的窗口期里,唯一确定能保值的投入,是那些无论最后哪种计价方式胜出都仍然有效的东西——结构化的内容、可核验的数据、跨渠道一致的品牌信息、以及一套自己能说清楚的度量口径。

前三者决定你能不能被引用,第四者决定你能不能向老板解释这件事。 而根据我们的语料观察,第四者恰恰是当前中文语境里最欠缺的——因为连"验收"这个词都还没有真正建立起来。


参考来源

本文引用的全部材料及其性质。凡未取到一手原文的,本文不予引用(如某些行业机构的调研因无法获取原文与方法学,全文未采用)。

法律文件(一手)

来源

内容

采集日

SEC EDGAR 全文检索

152 份文件、60 家公司;30 家明确提及 GEO/AEO;另有 101 份文件、34 家公司的"影响类"措辞

2026-08-20/21

巨潮资讯网全文检索

7 份公告、4 家公司(精确串匹配后)

2026-08-21

引力传媒(603598)风险提示公告

2026-01-13,公告编号 2026-005

2026-08-21

引力传媒《提质增效重回报行动方案》

2026-04-28

2026-08-21

SEMrush DEFA14A(Adobe 合并安排)

2025-11-19

2026-08-21

行业标准与调研(一手)

来源

内容

IAB《Measuring Visibility in the AI Era》

2026-08-03 发布,Final,约 35 页,由 IAB AI 副总裁 Caroline Giegerich 牵头;工作组含 Walmart、EMARKETER、Acxiom、WPP Media、Microsoft Clarity、PMG 等

The CMO Survey 第 35 版

Christine Moorman 主持(Duke University Fuqua School of Business),Deloitte 与美国营销协会赞助;2,111 位美国营利性公司营销负责人受邀,308 人应答(应答率 14.6%),97% 为 VP 及以上;调研期 2026-01-07 至 2026-01-29

WFA《The Future of Discoverability》

2026-06-08,合作方 DEPT®(代理商);27 个品牌,累计全球广告支出约 310 亿美元。全文在会员墙内,本文引用的是公开摘要页数据

学术文献(一手)

论文

出处

Liu, Zhang, Liang《Evaluating Verifiability in Generative Search Engines》

EMNLP 2023,arXiv:2304.09848,被引 428

Aggarwal 等《GEO: Generative Engine Optimization》

KDD 2024,arXiv:2311.09735,首次提交 2023-11-16

企业公开发布(一手)

来源

内容

采集日

Greenhouse / Lever 公开 ATS 接口

探测 71 个公司板子,30 个可用,覆盖 5,551 个在招岗位,标题级专职 GEO/AEO 岗 11 个

2026-08-20

Stripe / Asana / Datadog 职位页

Head of AEO & SEO 等岗位的 JD 原文

2026-08-20

杭州美仪自动化(Supmea)招聘与公开信息

GEO 优化师岗位

2026-08-20

第三方研究(二手,已标注局限)

来源

局限

Kevin Indig · Growth Memo《AI Halftime Report H1 2026》

主要为自有研究,样本量与方法未在文中完整披露

Kevin Indig 购物行为研究

样本为 56 人 / 221 次 ChatGPT 购物任务,样本量不大

社区语料(一手,但采样有偏)

来源

规模

已知偏差

中文社区评论

1,517 条甲方原声 + 所在视频标题

155 个采集关键词中,真正能触达"不知道 GEO 是什么的甲方"的不到 10 个;1,938 个账号中内容号占 69.1%、供给侧 15.8%,真实用户求助仅 41 个(2.1%)

Reddit 从业者社区

990 条,覆盖 r/SEO、r/bigseo、r/marketing 等

每次查询上限 100 条且老帖会被删,早期月份被低估,形状可信、绝对值偏保守

Reddit 甲方浓度版块

430 帖,覆盖 r/SaaS、r/Entrepreneur、r/shopify 等

英文侧同样存在软文污染:评赞比最高的几条"买家抱怨帖"作者在评论区自曝在做同类产品

本文所有实测抓取数据的采集与统计由透镜GEO 完成,口径见各章节标注。

北京时光不语科技有限公司是一家以技术为驱动的AI人工智能解决方案公司,为企业提供全域人工智能解决方案。

电话15611186501
地址北京市朝阳区广顺北大街17号北京市数字人基地三层
© 2026 北京时光不语科技有限公司 版权所有 京ICP备2025155669号-1