一个常被忽略的事实:你的网站 robots.txt 里可能已经写了「禁止爬取」——但你从来没做过这个决定。许多网站使用建站工具或 CMS 时,默认生成了过于保守的爬虫规则,结果把 GPTBot、ClaudeBot、Baiduspider 等 AI 训练和问答爬虫统统拦在了门外。robots.txt 是 AI 爬虫访问你网站的第一道门,门没开,后续所有 AIGEO 配置都是在空转。本文给出 2026 年主流 AI 爬虫清单、三种配置策略和四种真实场景的完整代码,以及与 llms.txt 联动的操作说明。
robots.txt(机器人排除协议)是一个放置在网站根目录的纯文本文件,通过 User-agent 字段指定哪些爬虫程序可以访问哪些路径;它不是强制性技术屏障,而是对遵守该协议的爬虫发出的「建议性指令」,主流搜索引擎和 AI 公司均承诺遵守。
robots.txt 的工作原理与 AI 爬虫的特殊性
robots.txt 的工作逻辑极其简单,但它与 AI 爬虫之间有一个关键区别需要搞清楚:传统搜索引擎爬虫抓取内容是为了建立可检索的索引,而 AI 爬虫抓取内容有两种完全不同的用途——训练数据采集和实时联网搜索,两者对 robots.txt 的响应逻辑并不相同。
传统搜索爬虫(如 Baiduspider、Googlebot)遵循 robots.txt 的禁止指令,会跳过被标记为 Disallow 的路径。AI 训练爬虫(如 GPTBot、Common Crawl)同样遵守 robots.txt,但它们的抓取是为了丰富语言模型的训练数据集,而不是实时检索。AI 联网搜索插件(如豆包的联网功能、Perplexity 的实时搜索)有时依赖独立的爬虫系统,也可能通过第三方搜索 API 获取结果——这部分行为对 robots.txt 的遵守程度因平台而异。
这意味着:正确配置 robots.txt 对 AI 训练爬虫的开放,是让你的内容进入下一轮模型训练数据集的前提条件;而对联网搜索爬虫的开放,则影响你的内容在 AI 实时搜索场景下能否被检索到。2026 年这两类需求已经无法用同一套旧规则覆盖,需要分层理解。
还有一个被低估的细节:robots.txt 文件必须放在网站根目录下(https://yourdomain.com/robots.txt),且必须能被不带 Cookie 的 GET 请求正常访问。部分网站的 robots.txt 因为 CDN 缓存配置错误或服务器权限问题返回 403/404,导致爬虫按照「无法读取指令」的默认行为处理——这个默认行为因爬虫类型不同而不同,可能是「放弃」,也可能是「谨慎抓取」。
2026 年主流 AI 爬虫 User-Agent 清单与默认行为
掌握当前主流 AI 爬虫的 User-Agent 标识是正确配置白名单的基础。截至 2026 年 Q2,主流 AI 平台的爬虫标识如下表所示,默认行为是指在 robots.txt 未明确声明该爬虫时的处置方式。
| 平台 | 爬虫 User-Agent | 用途 | 未配置时的默认行为 |
|---|---|---|---|
| OpenAI(ChatGPT) | GPTBot | 训练数据采集 | 遵守 * 通配符规则 |
| OpenAI(SearchGPT) | OAI-SearchBot | 实时搜索索引 | 遵守 * 通配符规则 |
| Anthropic(Claude) | ClaudeBot | 训练与搜索 | 遵守 * 通配符规则 |
| Google(Gemini) | Google-Extended | Gemini AI 训练 | 遵守 * 通配符规则 |
| Perplexity AI | PerplexityBot | 实时搜索引用 | 遵守 * 通配符规则 |
| 字节跳动(豆包) | Bytespider | 训练与搜索 | 遵守 * 通配符规则 |
| Common Crawl | CCBot | 开放训练数据集 | 遵守 * 通配符规则 |
| Apple(Siri/搜索) | Applebot-Extended | Apple AI 训练 | 遵守 * 通配符规则 |
| 百度(文心) | Baiduspider | 搜索+AI 摘要 | 遵守 * 通配符规则 |
需要特别说明:国内 AI 平台(Kimi/月之暗面、DeepSeek 等)截至 2026 年 Q2 尚未公开标准化的独立爬虫 User-Agent 声明,可能通过 Bytespider 或搜索 API 获取内容。建议在配置时保持 User-agent: * 对所有爬虫的基础开放,再用具名规则覆盖特殊需求。
「robots.txt 的配置逻辑应该反过来想:先问'我有什么不想让爬虫看',再针对性屏蔽,而不是先把门关上再想谁能进来。对于绝大多数提供公开内容的企业网站,把门全开反而是最简单、最正确的默认选择——那些有价值的后台、会员内容才值得用 Disallow 保护。」
云享耕科技,基于 30 余个 AIGEO 架构配置项目的实践归纳,技术运营团队
三种配置策略:全允许 / 选择性允许 / 选择性屏蔽
robots.txt 的配置策略本质上是一个访问控制决策:你希望 AI 爬虫看到什么、不看什么。对于大多数以获客为目的的企业官网,策略选择比技术实现更重要,因为选错了策略,所有后续 AIGEO 投入都可能白费。
策略一:全允许(推荐用于内容型企业官网)
如果你的网站内容是公开的,且希望被尽可能多的 AI 平台索引,这是最优选择。配置极简,覆盖所有已知和未知爬虫:
User-agent: * Allow: / Sitemap: https://yourdomain.com/sitemap.xml
这一行配置对所有遵守 Robots Exclusion Protocol 的爬虫开放整站。百度、Google、GPTBot、ClaudeBot 全部在覆盖范围内。
策略二:选择性允许(适用于有内容分区保护需求的网站)
如果你的网站有会员区、管理后台、私有文件目录等需要保护的路径,可以在全允许基础上添加针对性屏蔽:
User-agent: * Allow: / Disallow: /admin/ Disallow: /members/ Disallow: /private/ Sitemap: https://yourdomain.com/sitemap.xml
策略三:选择性屏蔽特定爬虫(适用于有 AI 训练数据授权顾虑的情形)
如果你不希望内容被用于 AI 模型训练(比如原创创作者、专业内容付费平台),但仍希望被搜索引擎索引和 AI 联网搜索引用,可以针对训练爬虫单独屏蔽:
User-agent: GPTBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: * Allow: / Sitemap: https://yourdomain.com/sitemap.xml
注意:屏蔽 AI 训练爬虫不会影响 Googlebot(标准搜索索引)或 Baiduspider,但会减少内容进入下一轮 AI 训练数据集的机会。对于以 AIGEO 为目标的企业官网,通常不建议这样做。如需了解完整的 AIGEO 技术架构,可参考AIGEO 基础架构服务的配置说明。
四个常见场景的完整配置代码
不同类型的企业网站在 robots.txt 配置上有差异化需求。以下四个场景覆盖了 2026 年最典型的企业网站类型,代码可直接复制使用,按实际情况替换域名和路径。
场景一:企业品牌官网(含智库博客,追求最大 AI 可见性)
这是对 AIGEO 效果要求最高的网站类型,建议对所有爬虫完全开放,并明确列出主流 AI 爬虫的具名允许规则,形成双重保障:
User-agent: * Allow: / User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ClaudeBot Allow: / User-agent: Google-Extended Allow: / User-agent: Bytespider Allow: / User-agent: PerplexityBot Allow: / User-agent: Baiduspider Allow: / Sitemap: https://yourdomain.com/sitemap.xml
这套配置目前已在云享耕科技官网(yunxg.cn)部署,是建站时 AIGEO 基础架构的标准配置之一,不额外收费。
场景二:有会员后台的营销型网站
User-agent: * Allow: / Disallow: /dashboard/ Disallow: /account/ Disallow: /checkout/ Disallow: /cart/ User-agent: GPTBot Allow: /blog/ Allow: /products/ Disallow: / Sitemap: https://yourdomain.com/sitemap.xml
场景三:医疗/法律行业官网(保护患者/客户隐私页面)
User-agent: * Allow: / Disallow: /patient-records/ Disallow: /case-files/ Disallow: /appointments/records/ Sitemap: https://yourdomain.com/sitemap.xml
场景四:内容创作者站(允许搜索引用,屏蔽 AI 训练采集)
User-agent: GPTBot Disallow: / User-agent: CCBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: Baiduspider Allow: / User-agent: Googlebot Allow: / User-agent: * Allow: / Sitemap: https://yourdomain.com/sitemap.xml
注意:robots.txt 的规则匹配遵循「最长 User-agent 匹配优先」原则。对同一爬虫有多条规则时,最具体的规则优先生效。已有建站或 AIGEO 技术问题,可通过AIGEO 自检清单逐项核查,包含 robots.txt 是否正确开放的验证步骤。
与 llms.txt 的配合使用
robots.txt 解决的是「AI 爬虫有没有权限进门」的问题,而 llms.txt 解决的是「进门之后,AI 应该优先读哪些内容」的问题。两者面向不同层次的 AI 系统:robots.txt 针对爬虫程序,llms.txt 针对大语言模型的内容理解逻辑。
llms.txt 是 2024 年由 fast.ai 创始人 Jeremy Howard 提出的一项约定,将网站最重要的内容(品牌描述、核心服务、FAQ、关键页面链接)以 Markdown 格式归纳在根目录的 /llms.txt 文件中,供 AI 在处理大量抓取内容时优先参考。2026 年已有多个主流 AI 平台和爬虫框架表示支持这一格式。
从已有的实践案例来看,百度 SEO 与 AIGEO 双轨的配置框架中,robots.txt 与 llms.txt 共同构成了「可见层」的技术基础:前者打开爬虫的访问权限,后者提供内容的优先级索引,两者缺一不可。如果 robots.txt 已经开放但没有 llms.txt,AI 爬虫会读取全站所有可访问内容,效率上远不如有 llms.txt 引导的网站。
一个最小可用的 llms.txt 结构如下:
# 云享耕科技 (yunxg.cn) > 网站建设、AI 功能定制与 SEO·AIGEO 优化服务。 ## 核心服务 - [企业品牌官网](https://yunxg.cn/pages/services/brand-website/index.html) - [微信小程序开发](https://yunxg.cn/pages/services/wechat-mini-program/index.html) - [AI 功能集成定制](https://yunxg.cn/pages/services/ai-customization/index.html) - [AIGEO 优化](https://yunxg.cn/pages/aigeo/index.html) ## 智库内容 - [云耕智库](https://yunxg.cn/blog/index.html): 建站、SEO、AIGEO 与获客实践
部署顺序建议:先检查和修复 robots.txt(确保 AI 爬虫开放),再部署 llms.txt(提供内容索引),最后补全各页面的 JSON-LD 结构化数据。这三层按顺序叠加,而不是可以随意替换。从什么是 AIGEO 这篇入门文章里,能看到三者在整体 AIGEO 架构中各自承担的角色。
验证配置是否生效
robots.txt 配置完成后,有三种方式可以验证生效情况:使用 Google Search Console 的「robots.txt 测试工具」逐条测试 URL 和 User-agent 的访问权限;直接访问 https://yourdomain.com/robots.txt 确认文件内容被正确渲染(而非返回 403/404);查看服务器访问日志,确认目标爬虫(如 GPTBot、ClaudeBot)的抓取记录。
一个容易被忽略的验证点:robots.txt 文件的 HTTP 响应头中,Content-Type 应为 text/plain,部分服务器配置错误会返回 text/html 导致部分爬虫解析异常。如果通过浏览器访问 /robots.txt 看到的是原始文本,通常没有这个问题;如果看到格式化的 HTML 页面,则需要检查服务器的 MIME 类型配置。
关于更新频率:robots.txt 本身是静态文件,改完立即生效。但爬虫的缓存周期通常是 24 小时到 7 天,改完后不需要等待——爬虫在下次访问时会读取新文件。百度搜索资源平台和 Google Search Console 均提供手动触发重新抓取 robots.txt 的功能,有需要可以主动请求刷新。
2026 年的一个新变化值得关注:部分 AI 平台开始在其爬虫声明页面提供「不希望被训练」的单独选择渠道(如 OpenAI 的内容排除表单),这为 robots.txt 之外提供了额外的控制层。对于希望精细控制训练数据授权的网站,robots.txt 配置加上平台的排除申请,才是完整的控制方案。
常见问题
Q:robots.txt 里写了 Allow,但 AI 还是没有抓取我的网站,是什么原因?A:robots.txt 开放只是前提,不是触发爬取的主动信号。AI 爬虫有自己的抓取优先级排队逻辑,通常优先抓取权重高、被引用多的网站。提高被抓取频率的方法:确保 sitemap.xml 链接出现在 robots.txt 末尾,并在 Google Search Console 和百度搜索资源平台主动提交 sitemap,同时通过内容更新保持爬虫活跃度。
Q:robots.txt 的 Disallow 能真正阻止 AI 爬虫进入那些路径吗?A:对主流且遵守协议的爬虫(GPTBot、ClaudeBot、Baiduspider、Googlebot 等)有效——这些公司明确承诺遵守 robots.txt。但 robots.txt 是「君子协议」,不是技术屏障:不遵守协议的爬虫可以无视它。真正需要保护的敏感路径(如后台、会员内容),应在服务器层面用身份验证保护,而不是单靠 robots.txt。
Q:我的网站有中文路径,robots.txt 里需要做特殊处理吗?A:中文路径需要进行 URL 编码后写入 robots.txt。例如,/关于我们/ 应写成 /%E5%85%B3%E4%BA%8E%E6%88%91%E4%BB%AC/。建议在规划 URL 结构时,对重要目录使用英文或拼音路径,避免多语言编码带来的配置复杂性。
A:Crawl-delay 指令对 Googlebot 无效(Google 使用 Search Console 里的抓取频率设置),对 Baiduspider 部分有效,对大多数 AI 爬虫的支持情况不一。2026 年,除非服务器带宽极为紧张,否则通常不需要写 Crawl-delay。大多数主流 AI 爬虫会根据服务器响应时间自动调节抓取频率。
robots.txt 是整个 AIGEO 技术栈里工作量最小、影响最大的一步——改一个文件,可能直接决定 AI 爬虫有没有机会读到你精心准备的所有内容。但它只是第一层,后面还有 JSON-LD 结构化数据、llms.txt 内容索引、答案先行写作格式等层层叠加。关于这几层配置如何协同检验,可以参考AIGEO 自检清单的完整核查流程。
值得追问的一个问题是:2026 年之后,随着越来越多 AI 平台开始公开爬虫标识和遵守说明,robots.txt 会演变成怎样的协议形态?OpenAI、Anthropic、Google 目前各自发布了独立的 AI 爬虫行为规范,但行业尚无统一标准。AIGEO 基础架构服务中会持续跟踪这些变化,更新配置建议。
本文首发于云享耕科技
参考文献
IETF RFC 9309 《Robots Exclusion Protocol》 (2022)
OpenAI 《GPTBot: Using the web responsibly》 (2023, 持续更新)
Anthropic 《ClaudeBot Crawler Information》 (2024)
Google Developers 《Google-Extended and Robots.txt》 (2026)
Jeremy Howard / fast.ai 《llms.txt: A standard for LLMs》 (2024)
百度搜索资源平台 《Robots 协议说明》 (2026)