实战方法·5 分钟读完·透镜GEO 实验室

robots.txt 屏蔽 AI 爬虫怎么设置:训练与检索分开配,别把自己从 AI 搜索里删掉

训练爬虫(GPTBot、Google-Extended、ClaudeBot)和检索爬虫(OAI-SearchBot、PerplexityBot)用的是不同 User-Agent,可以分开配置。一刀切封禁会在挡住训练的同时,把自己从 AI 搜索结果里移除。本文给出两类 UA 清单、三种 robots.txt 写法与四步自查清单。

本文要点

  • 训练爬虫(GPTBot、Google-Extended、ClaudeBot)和检索爬虫(OAI-SearchBot、PerplexityBot)用的是不同 User-Agent,可以分开配置。
  • 一刀切封禁会在挡住训练的同时,把自己从 AI 搜索结果里移除。
  • 本文给出两类 UA 清单、三种 robots.txt 写法与四步自查清单。

先给结论

如果你只想要一句话:不要用 Disallow: / 一刀切封所有 AI 爬虫。

训练类和检索类用的是不同的 User-Agent,可以分别控制:

用途

User-Agent

封了会怎样

模型训练

`GPTBot`、`Google-Extended`、`ClaudeBot`

内容不进训练语料,不影响被 AI 搜索引用

搜索检索

`OAI-SearchBot`、`Claude-SearchBot`、`PerplexityBot`

从 AI 搜索结果中消失

想保护版权但保留 AI 搜索曝光,就只封上面一行、放行下面一行。

三种配置写法

方案一|拒绝训练,保留检索(多数企业适用)

User-agent

规则

作用

GPTBot

Disallow: /

拒绝 OpenAI 训练抓取

Google-Extended

Disallow: /

拒绝 Google 训练抓取

ClaudeBot

Disallow: /

拒绝 Anthropic 训练抓取

OAI-SearchBot

Allow: /

保留 ChatGPT 搜索收录

PerplexityBot

Allow: /

保留 Perplexity 收录

写进 robots.txt 时,每条 User-agent 与其规则各占一行,两条之间空一行。

方案二|全部放行(希望最大化 AI 曝光)

不写任何 AI 爬虫规则即可,默认放行。

方案三|全部拒绝

对所有 User-agent(*)设 Disallow: /。★ 这就是 Reddit 在 2026 年 8 月的做法,后果见下一节。

想知道你的品牌是否被 AI 推荐?查看品牌 AI 可见性

配错的代价:一个可量化的案例

2026 年 8 月 20 日前后,Reddit 在 robots.txt 中加入了全域 disallow。

GEO 分析机构 Promptwatch 基于各大 AI 平台实时界面采集、累计超过 260 亿条引用与提示词的监测数据显示:

时间窗口

引用份额

7 月 18 日 – 8 月 7 日

3.83%

8 月 14 日 – 17 日

0.52%

相对降幅

86.4%

曲线形态是单日断崖而非渐进下滑——这与域名级封锁的预期一致:爬虫要么有权限,要么没有,没有中间状态。

不同平台的反应差异很大

同一时间窗口内:

平台

降幅

曲线形态

ChatGPT Search

−86.4%

单日断崖

Google AI Mode

−30.5%

渐进下降

Google AI Overviews

−11.3%

缓慢漂移

Google 系受影响明显更小。一个合理推测是双方之间的内容授权协议提供了缓冲——Reddit 与 Google 在 2024 年达成的协议价值每年 6000 万美元,目前正在续约谈判中。

这意味着:同一份内容能否被 AI 引用,正在部分取决于平台与 AI 厂商的商业关系,而不完全取决于内容质量。

补位的是第一方内容,不是其他论坛

2026 年 8 月 19 日的一项分析给出了更有信息量的观察:在 ChatGPT 中填补 Reddit 空缺的,不是其他社区平台,而是厂商技术文档、产品帮助中心,以及长期维护自有内容的品牌官方域名

对照此前的趋势——Tinuiti 2026 年 3 月的报告显示,2025 年 10 月至 2026 年 1 月间 Reddit 在其追踪的全部九个商业品类中引用份额至少增长 73%,Perplexity 的全部引用中 24% 来自 Reddit——这次变化的方向是从论坛讨论帖转向权威、直接的答案来源。

自查清单

配置完 robots.txt 之后,用这四步确认它真的按预期工作:

  1. 拉取线上文件curl https://你的域名/robots.txt,确认内容是你以为的那份
  2. 分清两类 UA:检索类(OAI-SearchBotPerplexityBot)有没有被 User-agent: * 的通配规则误伤
  3. 查服务器日志:过去 14 天有哪些 AI 爬虫真的来过、抓了哪些页
  4. ★ 验 IP,别只看 UA:AI 爬虫 UA 伪造非常普遍。我们在自己站上的实测是,按 UA 统计的 GPTBot 请求里只有约 1% 来自 OpenAI 官方 IP 段;ChatGPT-User 约 31%、OAI-SearchBot 约 37%。不验 IP 会把扫描器当成 AI 爬虫,得出完全相反的结论。

官方 IP 段可从这几个地址取:

  • https://openai.com/chatgpt-user.json
  • https://openai.com/searchbot.json
  • https://openai.com/gptbot.json

屏蔽 AI 爬虫合规吗?robots.txt 的法律效力

这是搜索里出现频率不低、但很少被正面回答的问题。三点需要分清:

一、robots.txt 不是技术强制,是声明。 它依赖爬虫方自愿遵守。主流厂商(OpenAI、Google、Anthropic)公开承诺遵守,但不遵守的爬虫在技术上完全可以无视它——这也是为什么单靠 robots.txt 挡不住恶意抓取,真要拦截需要在服务器层按 IP 或 UA 做规则。

二、拒绝抓取和主张权利是两件事。robots.txt 里写 Disallow 表达的是"我不希望你抓",它本身不构成授权协议,也不等同于版权声明。若要对内容使用主张权利,需要独立的版权声明与服务条款,robots.txt 只是意愿的技术表达。

三、封了不等于内容会从模型里消失。 已经进入模型参数的历史内容不受 robots.txt 变更影响,受影响的只有增量内容的实时检索可见性。这一点在评估"封锁能挽回什么"时经常被高估。

对企业而言更务实的顺序是:先明确内容资产的边界(哪些愿意被训练、哪些只愿被检索、哪些完全不公开),再落到 robots.txt 的具体配置,而不是反过来先封了再想。

两个容易忽略的事实

一、封锁不影响已经进入模型参数的历史内容。 robots.txt 变更影响的是增量内容的实时检索可见性,不会让模型"忘掉"已训练的部分。

二、Reddit 这次封锁发生在续约谈判期间,性质更接近谈判筹码而非永久决策。 若达成新条款,数据通道存在恢复的可能。

结论

robots.txt 里的一行配置,能在单日内改变一个平台在 AI 搜索中 86% 的引用份额。

对绝大多数企业而言,正确的做法不是二选一,而是分开配:拒绝训练抓取以保护内容资产,同时保留检索抓取以维持 AI 搜索可见性。配完之后按上面的自查清单验一遍,尤其是第 4 步的 IP 校验——只看 UA 得到的数字,有可能九成以上是假的。


资料来源

AI 爬虫 UA 伪造率数据来自透镜GEO 官网服务器日志,采集窗口 2026-08-27 至 2026-09-10,判定方法为按 OpenAI 官方公布的 IP 段逐条校验请求来源 IP。样本为单站数据,仅供参考。

相关阅读

你的品牌,AI 看得见吗?立即检测品牌