Robots.txt 检查器

粘贴你的 robots.txt 规则和想要测试的 URL 路径,检查器会读取 Allow 和 Disallow 行,告诉你该路径会被屏蔽还是被允许。当某个页面突然从谷歌消失、你想确认是否是过于严格的 Disallow 规则所致,或在起草新规则、上线文件前想验证某个路径时,都很有用。

检查器的工作方式

  1. 1

    粘贴你的规则

    把 robots.txt 中的 Allow 和 Disallow 行复制到框中,或起草新规则来试用。

  2. 2

    输入要测试的路径

    输入你想检查的 URL 路径,例如 /private/page。只填写路径,不要填完整域名。

  3. 3

    检查规则

    检查器会扫描 Allow 和 Disallow 行,找到与你输入的路径匹配的规则。

  4. 4

    查看结果

    你会看到找到的规则数量、测试的路径,以及判定结果:默认允许、被 Disallow 屏蔽,或被 Allow 允许。

最简正确的 robots.txt 文件

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
  • User-agent: *。适用于其他代码块中未明确指定名称的任何爬虫。
  • Allow: /。默认允许所有内容。
  • Disallow: /admin/。管理员目录禁止访问。
  • Sitemap:。告知搜索引擎在哪里查找 XML 站点地图。

Googlebot 实际遵循的规则

谷歌的解析器是解释歧义规则的事实标准:

  • 路径区分大小写。 /Admin//admin/ 不同。
  • 最长匹配优先。 对于以 /admin/public/ 开头的 URL,Allow: /admin/public/ 优于 Disallow: /admin/
  • 通配符。 * 匹配任意字符序列;$ 锚定在 URL 末尾。
  • 注释# 开头。
  • 与顺序无关。 规则按特异性(路径长度)评估,而非列出顺序。

常见错误

错误 效果
顶部为 Disallow: /,且无 Allow 整个网站被屏蔽
Disallow: *.pdf 许多解析器会忽略,请使用 Disallow: /*.pdf$
Disallow 中使用协议相对或绝对 URL 被忽略,路径必须为相对路径
规则前有多个 User-agent 会合并;规则适用于所有列出的 UA
路径末尾的尾随空格 会被悄悄视为不同的路径
将 robots.txt 放入子目录 仅获取根域名下的文件

robots.txt 与 noindex 的区别

robots.txt 指示爬虫不要抓取某个 URL。一个已被索引、随后在 robots.txt 中被屏蔽的页面可能会在索引中保留数月,因为爬虫无法抓取它以确认移除。若要将其移出索引,请在页面本身使用 noindex 元标签或 HTTP 头,并让爬虫能够看到它。

Crawl-delay

Crawl-delay: 10 请求每次请求之间间隔 10 秒。谷歌会忽略它(请在 Search Console 中设置抓取速率)。必应、Yandex 及部分小众爬虫会遵守它。适用于受小众爬虫抓取压力的小型网站。

Disallow 不能做的事

  • 阻止被链接。 其他网站仍可链接到被禁止的 URL,该 URL 会仅以网址形式出现在搜索结果中(没有标题或描述)。
  • 阻止页面被访问。 用户仍可访问被 Disallow 的 URL。
  • 对所有人隐藏该 URL。 robots.txt 是公开的;在其中列出秘密路径反而会暴露它们。

常见问题

因为 Disallow 阻止的是抓取,而非索引收录。若谷歌已通过链接或站点地图知道该 URL,仍可能在搜索结果中保留该网址。请在页面上添加 noindex 标签,并让谷歌抓取它以确认移除。

可以。请使用带有自定义规则的 User-agent: BadBot 块。请注意,行为不当的机器人会完全忽略 robots.txt,只有守规矩的机器人才会遵守它。

不应该。robots.txt 是公开的,把它列出来等于暴露了位置。请改用身份验证和服务器级别的访问控制。

是的,对路径而言。Disallow: /Admin/ 不会屏蔽 /admin/。请与你 URL 的实际大小写保持一致。

可以。请列出多条 Sitemap: 行,分别指向不同的 XML 站点地图或站点地图索引。

相关工具

此工具还提供其他语言版本