robots.txt 屏蔽 AI 爬虫怎么设置:训练与检索分开配,别把自己从 AI 搜索里删掉
训练爬虫(GPTBot、Google-Extended、ClaudeBot)和检索爬虫(OAI-SearchBot、PerplexityBot)用的是不同 User-Agent,可以分开配置。一刀切封禁会在挡住训练的同时,把自己从 AI 搜索结果里移除。本文给出两类 UA 清单、三种 robots.txt 写法与四步自查清单。
本文要点
- 训练爬虫(GPTBot、Google-Extended、ClaudeBot)和检索爬虫(OAI-SearchBot、PerplexityBot)用的是不同 User-Agent,可以分开配置。
- 一刀切封禁会在挡住训练的同时,把自己从 AI 搜索结果里移除。
- 本文给出两类 UA 清单、三种 robots.txt 写法与四步自查清单。
先给结论
如果你只想要一句话:不要用 Disallow: / 一刀切封所有 AI 爬虫。
训练类和检索类用的是不同的 User-Agent,可以分别控制:
|
用途 |
User-Agent |
封了会怎样 |
|---|---|---|
|
模型训练 |
`GPTBot`、`Google-Extended`、`ClaudeBot` |
内容不进训练语料,不影响被 AI 搜索引用 |
|
搜索检索 |
`OAI-SearchBot`、`Claude-SearchBot`、`PerplexityBot` |
从 AI 搜索结果中消失 |
想保护版权但保留 AI 搜索曝光,就只封上面一行、放行下面一行。
三种配置写法
方案一|拒绝训练,保留检索(多数企业适用)
|
User-agent |
规则 |
作用 |
|---|---|---|
|
GPTBot |
Disallow: / |
拒绝 OpenAI 训练抓取 |
|
Google-Extended |
Disallow: / |
拒绝 Google 训练抓取 |
|
ClaudeBot |
Disallow: / |
拒绝 Anthropic 训练抓取 |
|
OAI-SearchBot |
Allow: / |
保留 ChatGPT 搜索收录 |
|
PerplexityBot |
Allow: / |
保留 Perplexity 收录 |
写进 robots.txt 时,每条 User-agent 与其规则各占一行,两条之间空一行。
方案二|全部放行(希望最大化 AI 曝光)
不写任何 AI 爬虫规则即可,默认放行。
方案三|全部拒绝
对所有 User-agent(*)设 Disallow: /。★ 这就是 Reddit 在 2026 年 8 月的做法,后果见下一节。
配错的代价:一个可量化的案例
2026 年 8 月 20 日前后,Reddit 在 robots.txt 中加入了全域 disallow。
GEO 分析机构 Promptwatch 基于各大 AI 平台实时界面采集、累计超过 260 亿条引用与提示词的监测数据显示:
|
时间窗口 |
引用份额 |
|---|---|
|
7 月 18 日 – 8 月 7 日 |
3.83% |
|
8 月 14 日 – 17 日 |
0.52% |
|
相对降幅 |
86.4% |
曲线形态是单日断崖而非渐进下滑——这与域名级封锁的预期一致:爬虫要么有权限,要么没有,没有中间状态。
不同平台的反应差异很大
同一时间窗口内:
|
平台 |
降幅 |
曲线形态 |
|---|---|---|
|
ChatGPT Search |
−86.4% |
单日断崖 |
|
Google AI Mode |
−30.5% |
渐进下降 |
|
Google AI Overviews |
−11.3% |
缓慢漂移 |
Google 系受影响明显更小。一个合理推测是双方之间的内容授权协议提供了缓冲——Reddit 与 Google 在 2024 年达成的协议价值每年 6000 万美元,目前正在续约谈判中。
这意味着:同一份内容能否被 AI 引用,正在部分取决于平台与 AI 厂商的商业关系,而不完全取决于内容质量。
补位的是第一方内容,不是其他论坛
2026 年 8 月 19 日的一项分析给出了更有信息量的观察:在 ChatGPT 中填补 Reddit 空缺的,不是其他社区平台,而是厂商技术文档、产品帮助中心,以及长期维护自有内容的品牌官方域名。
对照此前的趋势——Tinuiti 2026 年 3 月的报告显示,2025 年 10 月至 2026 年 1 月间 Reddit 在其追踪的全部九个商业品类中引用份额至少增长 73%,Perplexity 的全部引用中 24% 来自 Reddit——这次变化的方向是从论坛讨论帖转向权威、直接的答案来源。
自查清单
配置完 robots.txt 之后,用这四步确认它真的按预期工作:
- 拉取线上文件:
curl https://你的域名/robots.txt,确认内容是你以为的那份 - 分清两类 UA:检索类(
OAI-SearchBot、PerplexityBot)有没有被User-agent: *的通配规则误伤 - 查服务器日志:过去 14 天有哪些 AI 爬虫真的来过、抓了哪些页
- ★ 验 IP,别只看 UA:AI 爬虫 UA 伪造非常普遍。我们在自己站上的实测是,按 UA 统计的 GPTBot 请求里只有约 1% 来自 OpenAI 官方 IP 段;ChatGPT-User 约 31%、OAI-SearchBot 约 37%。不验 IP 会把扫描器当成 AI 爬虫,得出完全相反的结论。
官方 IP 段可从这几个地址取:
https://openai.com/chatgpt-user.jsonhttps://openai.com/searchbot.jsonhttps://openai.com/gptbot.json
屏蔽 AI 爬虫合规吗?robots.txt 的法律效力
这是搜索里出现频率不低、但很少被正面回答的问题。三点需要分清:
一、robots.txt 不是技术强制,是声明。 它依赖爬虫方自愿遵守。主流厂商(OpenAI、Google、Anthropic)公开承诺遵守,但不遵守的爬虫在技术上完全可以无视它——这也是为什么单靠 robots.txt 挡不住恶意抓取,真要拦截需要在服务器层按 IP 或 UA 做规则。
二、拒绝抓取和主张权利是两件事。 在 robots.txt 里写 Disallow 表达的是"我不希望你抓",它本身不构成授权协议,也不等同于版权声明。若要对内容使用主张权利,需要独立的版权声明与服务条款,robots.txt 只是意愿的技术表达。
三、封了不等于内容会从模型里消失。 已经进入模型参数的历史内容不受 robots.txt 变更影响,受影响的只有增量内容的实时检索可见性。这一点在评估"封锁能挽回什么"时经常被高估。
对企业而言更务实的顺序是:先明确内容资产的边界(哪些愿意被训练、哪些只愿被检索、哪些完全不公开),再落到 robots.txt 的具体配置,而不是反过来先封了再想。
两个容易忽略的事实
一、封锁不影响已经进入模型参数的历史内容。 robots.txt 变更影响的是增量内容的实时检索可见性,不会让模型"忘掉"已训练的部分。
二、Reddit 这次封锁发生在续约谈判期间,性质更接近谈判筹码而非永久决策。 若达成新条款,数据通道存在恢复的可能。
结论
robots.txt 里的一行配置,能在单日内改变一个平台在 AI 搜索中 86% 的引用份额。
对绝大多数企业而言,正确的做法不是二选一,而是分开配:拒绝训练抓取以保护内容资产,同时保留检索抓取以维持 AI 搜索可见性。配完之后按上面的自查清单验一遍,尤其是第 4 步的 IP 校验——只看 UA 得到的数字,有可能九成以上是假的。
资料来源
- Reddit ChatGPT Citations Drop 86% (August 2026) — explainx.ai
- Reddit's AI Citation Share Just Grew 73% in the Categories That Matter — SaaS Intelligence
- Reddit Weighs Tighter Google AI Data Access in Deal Renewal Talks — WinBuzzer
- Robots.txt for AI Crawlers: GPTBot, ClaudeBot (2026) — Witscode
AI 爬虫 UA 伪造率数据来自透镜GEO 官网服务器日志,采集窗口 2026-08-27 至 2026-09-10,判定方法为按 OpenAI 官方公布的 IP 段逐条校验请求来源 IP。样本为单站数据,仅供参考。