robots.txt 误拦、meta nosnippet/noindex、以及跨平台实体冲突,都会让抓取或摘要失败,表现为问答里摘不到你的页面。本文提供可当场复现的自查与修复顺序,不使用无法核对原文的「73% 企业被静默绕开」统计,也不引用找不到原件的 Search Engine Journal 篇名。
AI 不可见的其他技术原因见AI 问答里品牌不可见:常见技术原因。完整 robots 策略见robots.txt 与 AI 爬虫配置。
五分钟自查顺序
按这个顺序查,避免一上来改内容。前三项任一失败,内容策略不会生效。
- 打开
https://你的域名/robots.txt,确认未 Disallow 整站或 /pages/。 - 查看页面源码是否有
noindex、nosnippet,或 HTTP 头X-Robots-Tag带相同指令。 - 禁用脚本刷新页面,确认正文仍在。
- 核对官网、地图、社媒的名称与官网 URL 是否指向同一主体。
- 用公开工具校验 JSON-LD,必填字段是否与可见正文一致。
「『静默绕开』听起来像阴谋。我们实际修过的站点,多半是 Disallow 了整站或把摘要禁掉了——改一行就能复现前后差异。」
— 徐勇,云享耕科技,robots 误配置排查
怎样修而不要过度放行
只放行需要被引用的公开页。后台、结算、含个人信息的路径应继续 Disallow。GPTBot 等爬虫的允许规则以各平台文档为准;允许抓取不等于同意训练,二者在部分平台是分开声明的。
Google 对 robots meta 与 data-nosnippet 的说明见参考文献。nosnippet 会限制摘要展示,可能让「可摘引片段」直接消失。
Q:为什么不再使用 73% 这个数字?A:旧文引用的 SEJ 2026 篇名找不到可打开原件,BrightLocal 等来源的 NAP 统计也不能挪到「AI 绕开官网」。删除无法核对的数字,比保留假精确更好。
Q:修完 robots 当天就会被引用吗?A:不会。只能验收「爬虫按协议可以抓」。索引与引用节奏不公开。
Q:小微站点要不要为每个 AI 爬虫写单独规则?A:先保证默认允许公开栏目、禁止后台。再按实际要支持的产品补 User-agent。不必一次写完全部已知机器人。
NAP 三端对齐见官网、地图、社媒一致性审计。
本文首发于云享耕科技
参考文献
IETF. RFC 9309 Robots Exclusion Protocol
Google Search Central. Robots meta tag, data-nosnippet, and X-Robots-Tag