先给结论:测出现状之后该怎么打,不取决于你想做什么,取决于三件事——你所在品类的成熟度、目标平台的信源结构、以及你的品牌在不在核心信源池里。这三件事决定了同一笔预算该投向哪里,以及你该盯哪个指标。盯错指标的代价,是花了钱却看不出有没有效。
一、先看品类:成熟品类看名次,新兴品类别看名次
同样是「问 AI 推荐什么」,不同品类的答案稳定程度差得很远。我们做过一轮重复观测,把两个品类放在一起比:
|
品类 |
AI 每次回答涉及的品牌池 |
所有模式都稳定出现的比例 |
|---|---|---|
|
成熟消费品类(跑鞋) |
14.7 个 |
44% |
|
新兴 B2B 品类(GEO 监测平台) |
28.6 个 |
24% |
最极端的一格出现在腾讯元宝上:问「GEO 优化效果好不好怎么衡量」,跨所有模式一共出现了 54 个品牌,而所有模式都稳定出现的只有 5 个——9%。
这个数字决定了指标的选择。在候选池 54、稳定核心只有 5 的品类里,AI 每次回答都在从一个巨大的池子里重新抽签。此时「我们这次排第 3」不是一个可复现的事实,名次的周环比变化几乎全是噪声——追求「排名提升」等于在优化一个随机变量。
|
品类特征 |
稳定共有率 |
该盯什么 |
不该盯什么 |
|---|---|---|---|
|
成熟品类 |
> 40% |
名次、进前三率 |
— |
|
新兴品类 |
< 25% |
是否进入稳定核心集合、引用源构成 |
名次的短期波动 |
新兴品类的正确目标是「挤进那 5 个稳定共有的核心集合」,不是「从第 8 升到第 5」。前者是可累积的,后者下周就会自己变回去。
二、再看平台:五个引擎吃的不是同一套内容
平台之间的差异,比品类差异和模式差异都大一个数量级。实测同一个品牌在两个引擎上的提及率相差 15 倍(94% 对 6%),而且两种模式下都一样——这说明不是采集方式的问题,是整个平台的信源池里没有这个品牌。
为什么会这样?看各引擎的信源结构就清楚了。以下数据来自我们2026 年 7 月的 AI 信源结构分析:
|
引擎 |
信源结构特征 |
对内容投放的含义 |
|---|---|---|
|
通义千问 |
专业媒体占比 33%,五引擎最高 |
最权威化。需要专业媒体或行业垂直媒体发稿背书,新品最吃亏 |
|
豆包 |
视频引用占 34%,且全部来自抖音 |
消费品类的视频红利在这里;B2B/工业品类因抖音供给稀缺,几乎吃不到 |
|
腾讯元宝 |
自媒体账号占引用约 70% |
达人图文是主通路,官方号权重相对低 |
|
文心一言 |
视频占 12%,其中 62% 来自哔哩哔哩 |
目标客群在 B 站的品牌值得单独布局 |
|
DeepSeek |
视频占比 0.4%,基本不引视频 |
纯图文战场,视频投入在这里回报接近零 |
同一份内容,在豆包和在千问面对的是两套完全不同的取材偏好。所以「五个引擎都做了」不是一个策略陈述,它等于没说。有意义的说法是:「客户主要用哪两个平台,我们按这两个平台的信源结构分配预算」。
一个直接可用的判断:消费品类优先在抖音铺短视频(豆包的红利在这里);B2B 与工业品类不要在视频上投钱(抖音供给稀缺、DeepSeek 与千问基本不引视频),把预算放在专业媒体与结构化图文上。全引擎共性是:榜单、教程、评测三类占图文被引的七成,资讯和单一案例几乎被忽略。
三、最后看位置:你在核心信源池内还是池外
这一条决定了你现在该做的是「守」还是「攻」,而它有一个很便宜的判断方法。
AI 在深度思考模式下会读更多网页——实测 DeepSeek 深度模式读 47 个源,快速模式只读 12 个,且快速模式的数量固定卡在 11–12。多读的那些源只影响榜单尾部,前几名由那 11–12 个高权重信源决定。
于是就有了这个信号:
|
现象 |
含义 |
该做什么 |
|---|---|---|
|
两种模式都能进榜 |
已在核心信源池内 |
守。模式差异与你无关,把精力放在维持信源不流失 |
|
深度模式能进、快速模式进不去 |
已被 AI 发现,但还没进核心池 |
攻。你只存在于第 13–47 个信源里,目标是把内容送进那 11–12 个高权重源 |
|
两种模式都进不去 |
尚未被该平台发现 |
先解决收录:内容在不在该平台常引用的那几类站点上 |
这个信号比排名早。如果只盯排名,内容发出去之后的两到八周里你什么都看不到,然后某天突然跳变;而引用源构成的变化,能提前几周告诉你这个过程正在发生。
四、三个维度合成一张打法表
|
你的处境 |
该盯的指标 |
预算优先投向 |
|---|---|---|
|
成熟品类 + 已在核心池 |
名次、进前三率 |
维持信源,防守为主 |
|
成熟品类 + 在池外 |
引用源构成、深度/快速模式的进榜差异 |
把内容送进该平台高频引用的信源 |
|
新兴品类 + 已在核心池 |
稳定共有率、引用源留存 |
扩大稳定问题集的覆盖面 |
|
新兴品类 + 在池外 |
是否出现在深度模式的引用列表 |
先求被收录,不看名次 |
|
出海 / 客户用 ChatGPT |
海外引擎的引用源 |
国内引擎的数据对你无参考价值 |
还有一条与品类无关的硬约束:内容不是发了就一直有效。我们的每日采集样本里,餐饮类内容在 AI 答案里的平均存活 5.3 天、工业类 3.9 天。这意味着按季度或年度采购、但只在期初投放一轮内容的做法,中后段基本是空转——补给节奏比单次投放量更重要。
五、什么阶段看什么指标
|
阶段 |
主指标 |
不看什么 |
判断依据 |
|---|---|---|---|
|
第 0–2 周:摸底 |
提及率、引用源清单 |
名次 |
还没投放,名次没有参照 |
|
第 2–8 周:投放期 |
引用源构成变化 |
名次 |
内容进引用池有数周滞后,名次此时不动是正常的 |
|
第 2–3 个月:验证期 |
稳定共有率、深度/快速模式差异 |
单次排名 |
要看趋势,不看单点 |
|
持续期 |
内容存活天数、引用源留存率 |
— |
决定补给节奏 |
需要提醒的是:任何阶段的「变化」,都要先跟噪声地板比。我们实测同一个问题、同一个模式原地重跑三次,名次平均相差 2.74 位,推荐名单每两次之间约 62% 的品牌不一样。低于这个幅度的变化,与「什么都没做」不可区分。完整的测算方法与原始数据见《AI 给的品牌排名准不准:126 次重复观测与噪声地板实测》。
常见问题
我的品牌该在哪个 AI 平台投入?
先看客户实际在用哪两个平台,再看那两个平台的信源结构。消费品类优先豆包——它的视频引用占 34% 且全部来自抖音;需要权威背书的行业优先通义千问——它的专业媒体占比 33%,是五引擎最高;目标客群在 B 站的可以看文心,它的视频引用 62% 来自哔哩哔哩。DeepSeek 视频占比只有 0.4%,在那里投视频回报接近零。
新品牌做 AI 可见度,多久能看到效果?
看你盯什么指标。如果盯名次,内容发出后两到八周里通常什么都看不到,然后可能突然跳变——这段时间容易被误判为无效。如果盯引用源构成,能提前几周看到变化:内容第一次出现在深度思考模式的引用列表里,就说明已经被收录;等它开始出现在快速模式里,说明进了核心信源池,此时名次才会真正开始动。
为什么我们排名一直在变,是不是投放没效果?
先跟噪声地板比再下判断。实测同一个问题、同一个平台、同一个模式原地重跑三次,名次平均相差 2.74 位,推荐名单每两次之间约 62% 的品牌不一样。也就是说什么都不做,名次也会在两三位之间飘。低于这个幅度的变化不能解释成投放效果,也不能解释成失效。
在新兴品类里,排名指标为什么不适用?
因为候选池太大而稳定核心太小。实测新兴 B2B 品类的平均品牌池 28.6 个,所有模式都稳定出现的只有 24%;最极端的一格是候选池 54 个品牌、稳定共有仅 5 个。在这种结构下 AI 每次回答都在重新抽签,名次的短期变化几乎全是噪声。正确的目标是挤进那个稳定核心集合,而不是提升某一次的名次。
内容发一次就够了吗?
不够。我们的每日采集样本里,餐饮类内容在 AI 答案里平均存活 5.3 天、工业类 3.9 天。按季度或年度采购但只在期初投放一轮的做法,中后段基本是空转。补给节奏比单次投放量更重要,具体频率应该按你所在品类的存活中位数来定。
数据来源与边界:品类稳定共有率、模式差异、噪声地板来自 2026 年 8 月底的一轮重复观测实验(2 个品牌 × 3 个平台 × 3 个问题 × 2–4 种模式 × 3 轮,共 126 次独立观测),原始记录见该实验的完整报告;各引擎信源结构与内容存活天数来自我们 2026 年 7 月的AI 信源结构分析,口径为账号级判定、按真实引用事件加权。两份数据都是我们自己的抽样统计,能说明观察到的现象,不能外推为全行业规律。