实战方法·6 分钟读完·透镜GEO 实验室

没有 Agent,GEO 还能怎么做:一个人的最小可执行闭环

GEO 五个核心动作里,只有规模化采样离不开自动化,其余四个手工能做。本文给出一个人的最小闭环:问题集配比、三条采样纪律,以及三条「没到这条线就别买」的触发线。

本文要点

  • GEO 五个核心动作里,只有规模化采样离不开自动化,其余四个手工能做。
  • 本文给出一个人的最小闭环:问题集配比、三条采样纪律,以及三条「没到这条线就别买」的触发线。

现在讲 GEO 的内容里,有一半在卖 Agent。

写稿 Agent、策略 Agent、监测 Agent——听起来这件事没有自动化就做不了。

不是的。GEO 的核心动作有五个,其中只有一个真的离不开自动化,其余四个手工就能做。

代价是频率和覆盖面,不是"做不了"。这篇文章把这条边界画清楚:手工能做到哪一步,什么时候必须上工具,以及没到哪条线就别花这个钱。


一、五个动作,只有一个卡在规模上

先把 GEO 的动作拆开:

```
① 定问题集 手工可做 —— 决定测什么,这一步质量最重要,反而最不该自动化
② 固定身份提问 手工可做 —— 但要守纪律,身份一变数据就没有可比性
③ 留存原始回答 手工可做 —— 截图/复制全文,比只记排名有用得多
④ 追溯引用源 手工可做 —— 逐条点开看,慢但准
⑤ 规模化重复采样 ★ 卡在这里 —— 这一步是真的需要自动化
```

只有第 ⑤ 步卡在规模上。 前四步的瓶颈是纪律,不是算力。

为什么第 ⑤ 步是硬瓶颈?因为两个数字:

```
内容被引续航 餐饮 5.3 天(全行业最长) · 工业 3.9 天(全行业最短)
同题重复采样 同一个问题连问两次,两次的引用来源集合经常对不上
★ 这是机制决定的:产品端每次提问都会重新检索,
材料一变,答案组织方式就变
```

第一个数字定复测频率下限,第二个数字定单次采样的可信度下限。

内容大约 4 到 5 天就会掉出引用池,意味着你至少每周要复测一次;而单次提问的结果本身就有波动,意味着同一个问题要问多次才能确认一个变化是真的。

这两条乘起来,就是手工方案的天花板。


二、手工方案能撑住多少:一张可以自己算的表

按"每个问题每周复测一次、每次在两个引擎上各问一遍、每次留存原始回答"来估:

```
单个问题单次 提问 + 等待 + 复制全文 + 记录引用源 约 3 分钟
每周每问题 2 个引擎 × 1 次 约 6 分钟
```

于是:

```
20 个问题 每周 2 小时 一个人兼职能撑住
50 个问题 每周 5 小时 需要专人一天
100 个问题 每周 10 小时 手工方案的实际上限
200 个问题 每周 20 小时 ★ 已经不现实
```

结论很直接:一个人手工能稳定维护的,大约是 50 个问题以内、两个引擎。

这不是一个小数字。对一家刚开始做 GEO 的中小企业,50 个核心问题已经能覆盖主要的选型场景。


想知道你的品牌是否被 AI 推荐?查看品牌 AI 可见性

三、问题集怎么定:这一步最不该省,也最不该自动化

手工方案里唯一不能凑合的就是这一步。 问题选错,后面全白做。

我们用 1047 条真实 query 做过一次分区实测。把问题按是否含品牌名、含谁的品牌名分成五个区,测"跑偏率"——AI 的回答偏离提问原意的比例:

```
空白区(问题里不含任何品牌名) 跑偏率 13.3%
有品牌名的三个区 跑偏率 5.4% ~ 6.6%
```

空白区的跑偏率是有品牌名区域的两倍多。

而新手最容易去测的恰恰是空白区的泛词——"GEO 工具哪个好"这类。在一个跑偏率 13.3% 的区里测出来的结果,本身就带着可观的噪声。

手工方案的问题集配比建议(总量 30~50 条):

```
品牌词 5~8 条 "XX品牌怎么样" —— 跑偏率最低,是你的基线锚点
品类词 15~20 条 "预算X、场景Y,推荐哪家" —— 这是真正的战场
竞品词 5~8 条 "A和B哪个好" —— 看你在对比语境里的位置
空白泛词 5 条以内 ★ 只留少量,因为跑偏率高、噪声大
```

用你客户的原话写问题,不要用关键词。 AI 对话里的提问是带背景、预算、场景的完整句子,不是搜索框里的短词组。


四、固定身份:手工最容易破功的地方

AI 会根据对话上下文和历史调整答案。同一个问题,换个账号问,结果可能不一样。

手工方案必须守三条纪律:

```
□ 每次用同一个账号、同一个入口(网页端和 APP 端的答案不同,不要混)
□ 每次新开对话,不要在有上下文的会话里追问
□ 每次记录时间 —— 同一天不同时段结果也会变
```

破了任何一条,你的两次数据就不能比较。 这是手工方案最容易在第三周开始松懈的地方。


五、留原始回答:比记排名有用十倍

多数人手工做监测时,记的是"我排第几"。

这个数字单独拿出来没有用。 排名从第 3 掉到第 7,你拿着这个数字去问任何人,得到的回答都只能是"算法波动"——因为你手里只有位置,没有 AI 当时到底说了什么、引用了谁。

留原始回答全文,成本只多 30 秒,但它让下面这些问题变得可回答:

```
掉名次是因为竞品说得更好,还是因为 AI 引用的信源换了?
AI 对我们的描述是准确的,还是把参数说错了?
它引用的那几个来源,是我们能影响的,还是完全够不着的?
```

引用源逐条点开看,这件事手工做完全可行,而且比任何汇总分数都更能指导下一步。


六、什么时候该上工具:三条可量化的触发线

这一节是这篇文章里最该诚实的部分。

没到下面这三条线,手工方案够用,不用花这个钱:

```
触发线 1 · 问题数超过 50 条
按每周复测一次算,一个人每周要花 5 小时以上
—— 这是人力成本超过工具成本的交叉点

触发线 2 · 需要覆盖 3 个以上引擎
两个引擎手工可控;三个以上,工作量线性增长而注意力不会
—— 而且跨引擎对齐(同一批问题、同一时间窗)手工很难保证

触发线 3 · 需要向第三方证明效果
自己截图自己算,在内部沟通里够用
但要向老板、客户或投资人证明,需要可复现的原始数据与留痕
—— 这一条和规模无关,和"谁来信"有关
```

反过来说:

```
问题数 < 30、只做 1~2 个引擎、只用于内部判断方向
→ 手工方案不但够用,而且因为你亲手读了每一条回答,
你对"AI 到底怎么说我们"的理解会比看报表深得多
```

我们见过不少团队在第一年靠一个 Excel 就把方向摸清楚了。 先手工做三个月再决定要不要上工具,比一上来就买一套系统更划算——至少你会知道自己真正需要哪几个功能。


七、一个人的最小闭环:完整流程

```
第 1 周 定问题集 30 条(品牌 5 / 品类 18 / 竞品 5 / 泛词 2)
在 2 个引擎上各跑一遍,留存全部原始回答
★ 这就是你的基线,之后所有判断都以它为准

第 2~4 周 不做任何优化动作,只重复采样
目的:先摸清楚「什么都不做时,数据本身波动多大」
★ 跳过这一步,你会把正常波动当成优化效果

第 5 周起 开始做内容,每次只改一个变量
每周复测一次,每次和基线比,不和上周比

每月一次 回看引用源:哪些来源反复出现?它们是你能影响的吗?
这张清单决定你下个月把内容发在哪里
```

第 2~4 周那一步最容易被跳过,也最不该跳过。 没有空转期的基线,你分不清"优化生效了"和"这周 AI 心情好"。


附:数据出处

  • 五区跑偏率:1047 条真实 query 分区实测。
  • 内容被引续航:2026 年 8 月五引擎信源观测,五引擎、8 个入口、22 个行业、
    2100 多个品牌,近 15 万次 AI 问答、2263 万条引用记录,按占比口径。
  • 同题重复采样的波动:机制性描述,未附具体统计量
    ★ 2026-09-21 核查:原稿引用的「75.3 万条引用重复采样实验」在知识库中
    查无出处,已删除。不得恢复,除非补上可核验来源。
  • 第二节的时间估算是按上述频率推算的工作量,非实测值,正文已说明是"估"。

相关阅读

你的品牌,AI 看得见吗?立即检测品牌