robots.txt 误拦、meta nosnippet/noindex、以及跨平台实体冲突,都会让抓取或摘要失败,表现为问答里摘不到你的页面。本文提供可当场复现的自查与修复顺序,不使用无法核对原文的「73% 企业被静默绕开」统计,也不引用找不到原件的 Search Engine Journal 篇名。

AI 不可见的其他技术原因见AI 问答里品牌不可见:常见技术原因。完整 robots 策略见robots.txt 与 AI 爬虫配置

五分钟自查顺序

按这个顺序查,避免一上来改内容。前三项任一失败,内容策略不会生效。

  1. 打开 https://你的域名/robots.txt,确认未 Disallow 整站或 /pages/。
  2. 查看页面源码是否有 noindexnosnippet,或 HTTP 头 X-Robots-Tag 带相同指令。
  3. 禁用脚本刷新页面,确认正文仍在。
  4. 核对官网、地图、社媒的名称与官网 URL 是否指向同一主体。
  5. 用公开工具校验 JSON-LD,必填字段是否与可见正文一致。
「『静默绕开』听起来像阴谋。我们实际修过的站点,多半是 Disallow 了整站或把摘要禁掉了——改一行就能复现前后差异。」

— 徐勇,云享耕科技,robots 误配置排查

怎样修而不要过度放行

只放行需要被引用的公开页。后台、结算、含个人信息的路径应继续 Disallow。GPTBot 等爬虫的允许规则以各平台文档为准;允许抓取不等于同意训练,二者在部分平台是分开声明的。

Google 对 robots meta 与 data-nosnippet 的说明见参考文献。nosnippet 会限制摘要展示,可能让「可摘引片段」直接消失。

Q:为什么不再使用 73% 这个数字?

A:旧文引用的 SEJ 2026 篇名找不到可打开原件,BrightLocal 等来源的 NAP 统计也不能挪到「AI 绕开官网」。删除无法核对的数字,比保留假精确更好。

Q:修完 robots 当天就会被引用吗?

A:不会。只能验收「爬虫按协议可以抓」。索引与引用节奏不公开。

Q:小微站点要不要为每个 AI 爬虫写单独规则?

A:先保证默认允许公开栏目、禁止后台。再按实际要支持的产品补 User-agent。不必一次写完全部已知机器人。

NAP 三端对齐见官网、地图、社媒一致性审计

本文首发于云享耕科技

参考文献

IETF. RFC 9309 Robots Exclusion Protocol

Google Search Central. Robots meta tag, data-nosnippet, and X-Robots-Tag

OpenAI. GPTBot documentation