GEO 在线分析怎么做:浏览器里能跑完的四步
不装软件、不申请 API、不写代码,浏览器里一个下午跑完一轮 GEO 分析。四步:问题集怎么配、条件怎么固定、每条答案记哪四个字段、怎么压成三个能开会的数。附三条边界。
本文要点
- 不装软件、不申请 API、不写代码,浏览器里一个下午跑完一轮 GEO 分析。
- 四步:问题集怎么配、条件怎么固定、每条答案记哪四个字段、怎么压成三个能开会的数。
- 附三条边界。
不装软件、不申请 API、不写代码,用浏览器能把 GEO 分析做到哪一步?
比多数人以为的远。下面四步,一个下午能跑完一轮,产出是一张你能拿去开会的表。
先说清楚边界:浏览器方案做不了规模化和长期趋势(第五节会说明为什么)。但它能回答最要紧的那几个问题——AI 现在怎么说我们、引了谁、和谁并列。
第一步:把问题写对(这一步决定后面全部)
这是唯一不能省的一步,也是最容易做错的。
多数人打开豆包,输入自己的品牌名,看看有没有被提到。这个动作的信息量接近于零——搜品牌名时被提到是常态,它不代表任何竞争力。
真正有信息量的是用户真实会问的话。而用户的提问是带背景、预算、场景的完整句子,不是搜索框里的短词组。
我们用 1047 条真实 query 做过一次分区实测,按问题里是否含品牌名分区,测「跑偏率」——AI 回答偏离提问原意的比例:
```
空白区(问题里不含任何品牌名) 跑偏率 13.3%
含品牌名的三个区 跑偏率 5.4% ~ 6.6%
```
空白区的跑偏率是有品牌区的两倍多。 而新手最爱测的恰恰是空白泛词。
一个下午能跑完的问题集,建议这样配(总共 12 条):
```
品牌词 2 条 「XX怎么样」「XX和YY比」—— 你的基线锚点
品类词 7 条 ★ 主力。照这个模板写:
「预算___、___场景、___要求,推荐哪家」
例:「预算三千、家里养猫、客厅铺地毯,推荐哪款扫地机器人」
竞品词 2 条 「A和B哪个好」—— 看你在对比语境里的位置
泛词 1 条 ★ 只留一条,跑偏率 13.3%,噪声大
```
把这 12 条写进一个表格,先写完再开始测。 边测边想问题,会不自觉地挑对自己有利的问法。
第二步:固定条件,然后开测
浏览器方案最容易破功的地方在这里。条件不固定,测两次等于测了两个不同的东西。
```
□ 同一个账号,全程不换
□ 同一个入口 —— ★ 网页端和 APP 端答案不同,选一个,别混
□ 每条问题新开一个对话,不要在有上下文的会话里追问
□ 记录时间,精确到小时
```
为什么「新开对话」这条要单列:在同一个会话里连问三个品类问题,第二、三个的答案会被前面的对话影响。这是浏览器手工测最常见的污染源,而且它不报错,你看不出来。
测几个引擎:一个下午的话,选 2 个。选哪两个取决于你的生意在哪:
```
主营天猫淘宝 千问优先
主营微信生态 元宝优先
主营抖音电商 豆包优先
B2B / 技术向 DeepSeek 优先
不确定 豆包 + DeepSeek
```
想知道你的品牌是否被 AI 推荐?查看品牌 AI 可见性 →
第三步:每条答案记四个字段(别只记排名)
这一步是浏览器方案和"随手问问"的分水岭。
每问完一条,复制这四样进表格:
```
① 回答全文 整段复制,不是截图,不是摘要
② 出现了哪些品牌 按答案里的先后顺序列出来,包括你和别人
③ 引用了哪些来源 点开每一个引用角标,把域名或账号名记下来
④ 它怎么描述你的 ★ 最容易被跳过,也最有价值的一项
```
第 ④ 项单独说。 被提到不等于被说好话。AI 给你的定语是什么?参数说对了吗?和竞品并列时,谁的描述更具体?
排名上升而描述恶化,是完全可能同时发生的——只记排名的分析看不见这件事。
第 ③ 项是下个月内容该发哪儿的唯一依据。 一个几百粉丝的账号提你一次,和一个行业媒体提你一次,在"提及 +1"这个口径下完全一样,实际价值差很远。
第四步:把 12 条答案汇总成三个数
测完 12 条,表格里是 12 段文本。把它们压成三个能开会用的数:
```
① 提及率 = 出现品牌名的条数 / 12
② 引用率 = 带可点击来源且来源指向你的条数 / 12
③ 空白率 = 只推荐了品类、没点名任何品牌的条数 / 12
```
这三个必须分开算,不能合并成一个「曝光量」。 因为它们指向完全不同的动作:
```
提及率高、引用率低 内容进了模型的记忆,但没进当次检索的信源池
→ 动作:让内容出现在能被检索到的渠道
引用率高、提及率低 来源被采信了,但品牌名没被说出来
→ 动作:内容里的品牌表述要更明确
空白率高 这个品类的问题 AI 还没形成推荐习惯
★ 这是好消息,意味着位置还空着
```
再把第三步 ③ 的引用源做个频次统计:哪几个域名反复出现?这张清单就是你下个月的渠道清单。
五、浏览器方案的三条硬边界
说清楚做不到什么,比夸大能做到什么有用。
边界一:拿不到趋势。
内容被 AI 引用之后活不了多久:
```
餐饮 5.3 天(全行业最长)
工业 3.9 天(全行业最短)
口径 每日采集,连续 2 天未被引判定结束
```
大部分行业落在 4~5 天。这意味着要看趋势,至少每周重跑一次。 手工重跑 12 条题、2 个引擎,大约 1 小时——能撑住,但撑不到 50 条题。
边界二:单次采样分不清波动。
同一个问题连问三次,结果可能就不一样。所以第四步那三个比率,是那一天那一次的值,不是稳定值。
一个改进办法:把最重要的 3 条题各问三遍,看三遍差多少。差得大的题,之后不要用来做判断。
边界三:规模上限大约 50 条题、2 个引擎。
按每题 3 分钟、每周复测一次估:
```
12 条题 每周约 1 小时 ★ 本文的配置,一个人兼职能长期维持
50 条题 每周约 5 小时 需要专人半天
100 条题 每周约 10 小时 手工方案的实际上限
```
超过这个规模,问题不是"做不了",是"做不稳"——第三周开始,固定条件那四条纪律就会松。
六、今天就能做的最小版本
如果连一个下午都没有,做这三条,20 分钟:
```
□ 1. 写 3 条你客户会问的话(带预算、带场景,不含你的品牌名)
□ 2. 在豆包和 DeepSeek 各问一遍,复制全文到一个文档里
□ 3. 点开每个引用角标,把域名记下来
看两件事:
· 答案里出现了谁?有没有你?
· 引用的那几个来源,是你能影响的,还是完全够不着的?
★ 第二个问题的答案,通常比排名更让人清醒。
```
附:数据出处
- 五区跑偏率 13.3% / 5.4%~6.6%:1047 条真实 query 分区实测。
- 内容被引续航天数、8 个入口口径:2026 年 8 月五引擎信源观测,
追踪 DeepSeek、文心、豆包、元宝、千问的网页端与移动端共 8 个入口,
覆盖 22 个行业、2100 多个品牌,按占比口径。
续航口径:每日采集、连续 2 天未被引判定结束。 - 第五节的工时估算是按上述频率推算的,非实测值,正文已说明是"估"。