平台观察·5 分钟读完·透镜GEO 实验室

做 GEO 必看:WorkBuddy 靠 Tavily 搜索,进索引才是第一道门

内容没被 AI 采信,往往不是模型不认可你,而是它压根没看到你。WorkBuddy 这类 AI 助手的联网搜索依赖 Tavily,连索引都没进,后面的优化都是自嗨。本文拆两层机制:Tavily 的底层收录规则(含实测——Google 收录良好不等于 Tavily 收录良好),以及 Agent 的四步筛选决策链。

本文要点

  • 内容没被 AI 采信,往往不是模型不认可你,而是它压根没看到你。
  • WorkBuddy 这类 AI 助手的联网搜索依赖 Tavily,连索引都没进,后面的优化都是自嗨。
  • 本文拆两层机制:Tavily 的底层收录规则(含实测——Google 收录良好不等于 Tavily 收录良好),以及 Agent 的四步筛选决策链。

很多做 GEO(Generative Engine Optimization,生成式引擎优化)的团队常陷入一个误区:拼命提升文章的事实密度、制作结构化表格、增加权威背书,但发出去的内容依然没被 AI 采信。

问题往往不是模型不认可你,而是它压根"没看到"你。

像 WorkBuddy 这类 AI 助手的联网搜索能力并非自研,而是深度依赖 Tavily——一个专门面向 AI Agent 的搜索 API。如果你的内容连 Tavily 的索引库都没进去,后面所有的内容优化都只是自嗨。

要让品牌真正出现在 AI 助手的回答中,必须厘清两大核心机制:底层索引准入Agent 筛选决策

第一重关卡:Tavily 的底层收录机制

内容能否被 AI 引用,第一关不是模型愿不愿意采信,而是索引库里有没有你。

这个阶段的失败是完全"静默"的——没有报错,没有通知,你只是单纯地"不存在"。

Tavily 收录的三条特殊规则

规则

官方说明

对你意味着

爬虫不可识别

不使用专属 User-Agent,避免被网站区别对待

你无法单独识别、放行或封禁它

绑定 Googlebot

完全跟随 Googlebot 的可抓取性

被 Googlebot 屏蔽的页面,Tavily 绝对抓不到

robots.txt 不阻止收录

官方明确不通过 robots.txt 阻止索引

要下架必须部署 `noindex`,且需等重新抓取后生效

反直觉实测:Google 收录良好 ≠ Tavily 收录良好

实测中发现一个极其关键的现象:站点被 Tavily 收录,不等于站点的"新内容"被 Tavily 收录。

对一个 GEO 结构完善、声明了 Content-Signal、Sitemap 正常、Google 已收录数百页的站点做 API 实测:

  • 整体域名确实在 Tavily 索引中,且早期文章的检索权重很高
  • 但近一个月内发布的二十余篇新文章中,仅有 2 篇能被检索到
  • 用 Extract 接口实时抽取首页与新文章页,解析均完全成功——排除了页面无法解析的可能

结论:Tavily 的索引更新存在严重的时间滞后。即使是高权重的成熟域名,新文章发布后也必须经历漫长的排队。

准入与排序:必须拆开看的两层结构

层级

决定因素

性质

核心动作

准入层(进池)

Googlebot 可抓取性、索引更新时效

布尔判断(0 或 1)

确保抓取路径通畅、主动提交 Sitemap、验证新内容收录状态

排序层(排位)

信源权威度、交叉验证、查询相关性、证据质量

权重计算与评分

提升事实密度、优化结构化数据、建立权威引用

行业讨论几乎全部集中在排序层,而准入层的失败没有任何提示。

第二重关卡:WorkBuddy 搜索决策链拆解

拿到 Tavily 的索引门票后,内容还要通过 AI Agent 的四步决策链。

第一步:判断"要不要搜"(意图分流)

Agent 遇到问题时,首先识别意图:

问题类型

举例

处理方式

定义 / 认知类

"XX 品牌怎么样"

直接用预训练数据回答,压根不触发联网搜索

易变 / 时效类

"XX 软件现在的价格 / 最新功能"

强制触发实时搜索

GEO 启示:靠实时 SEO 无法解决"品牌认知"问题。认知类问题的曝光依赖内容在模型预训练数据集里的覆盖度,实时搜索优化只对易变信息生效。

第二步:搜索词"二次翻译"

Agent 不会直接把用户原话丢进搜索引擎,而是做意图拆解与标准化翻译——加上地区、年份、机构类型、具体产品名等限定词,把宽泛查询转成长尾精确查询。

GEO 启示:标题写得大而无当(如"全网最全指南")很难被命中。能精准匹配概念组合长尾限定条件的内容更容易被拉取。

第三步:通过四层结果漏斗

Tavily 返回原始数据后,Agent 会做极其严格的二次筛选:

层级

判据

淘汰什么

1 · 域名等级过滤

政府 / 官报 > 官方主站 > 大型权威站

营销站、低质 UGC

2 · 时间戳清洗

价格、政策类需在有效期内

过期信息

3 · 交叉验证

核心事实须在两个以上独立源一致出现

单源独家信息(孤证不采信)

4 · 软文特征识别

文末转化诱导语检测

带"立即预约""扫码领优惠"的内容

GEO 启示

  • 批量堆砌的 SEO 垃圾站在第一层就被刷掉
  • 仅仅在自己官网上宣称"行业第一"会被第三层直接过滤
  • 文末带强烈营销转化诱导的内容会被第四层秒杀

第四步:触发"停搜标准"

Agent 的搜索极其克制。一旦候选集里包含了足够数量的权威来源、数据能形成对比、且无逻辑冲突,就会立即停止搜索。

由于每次检索最终调取入模型的候选集极小(通常仅为个位数),先入池、先被找出来的优质内容会迅速占满名额,排在后面的内容再好也无济于事

想知道你的品牌是否被 AI 推荐?查看品牌 AI 可见性

实操指南:如何验证与执行

避开 API 验证中的两个隐形坑

用 Tavily API 自查域名收录时,要警惕静默失败——参数写错不报错,只安静地返回空结果:

陷阱

错误写法

正确写法

错误后果

前缀陷阱

`include_domains: ["geo.timus.cn"]`

必须带 `https://` 协议前缀

返回 0 条,误判为未收录

阈值陷阱

`max_results: 15` 或 `20`

设为 10 以内

不降级不报错,直接返回空

必须设置对照组:测自己域名时,务必用同一套参数去跑一个已知会命中的大型网站,确保测试方法本身有效——避免把"接口异常"误判成"未被收录"。

GEO 标准落地五步法

步骤

做什么

验证什么

1

查 `robots.txt`

通用爬虫与 Googlebot 路径完全畅通

2

跑 Extract 接口测试核心页面

区分"抓不到 / 解析失败"与"单纯没来抓"

3

带对照组做域名限定搜索

域名是否在 Tavily 索引池中

4

按发布时间段统计收录率

不满足于"网站已被收录",要细化到"近 30 天新内容收录率"

5

分流打法

见下表

第五步的分流

流向

针对什么信息

打法

实时检索流

时效、价格、对比类

去软文化的高密度事实输出,多平台布局以满足交叉验证

训练数据流

品牌认知与定义类

放弃实时 SEO 思路,通过广泛的第三方媒体、论坛与权威阵地建立长期沉淀

总结

GEO 的本质不是"被搜索引擎找到",而是在 Agent 极度有限的候选名额里争夺极少数席位。

做 GEO 优化,请务必先把视角从"模型喜不喜欢我的文章"拉回到最底层——

我的新内容,今天进 Tavily 索引库了吗?

相关阅读

你的品牌,AI 看得见吗?立即检测品牌