Robots.txt 检查器
粘贴你的 robots.txt 规则和想要测试的 URL 路径,检查器会读取 Allow 和 Disallow 行,告诉你该路径会被屏蔽还是被允许。当某个页面突然从谷歌消失、你想确认是否是过于严格的 Disallow 规则所致,或在起草新规则、上线文件前想验证某个路径时,都很有用。
检查器的工作方式
-
1
粘贴你的规则
把 robots.txt 中的 Allow 和 Disallow 行复制到框中,或起草新规则来试用。
-
2
输入要测试的路径
输入你想检查的 URL 路径,例如 /private/page。只填写路径,不要填完整域名。
-
3
检查规则
检查器会扫描 Allow 和 Disallow 行,找到与你输入的路径匹配的规则。
-
4
查看结果
你会看到找到的规则数量、测试的路径,以及判定结果:默认允许、被 Disallow 屏蔽,或被 Allow 允许。
最简正确的 robots.txt 文件
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
- User-agent: *。适用于其他代码块中未明确指定名称的任何爬虫。
- Allow: /。默认允许所有内容。
- Disallow: /admin/。管理员目录禁止访问。
- Sitemap:。告知搜索引擎在哪里查找 XML 站点地图。
Googlebot 实际遵循的规则
谷歌的解析器是解释歧义规则的事实标准:
- 路径区分大小写。
/Admin/与/admin/不同。 - 最长匹配优先。 对于以
/admin/public/开头的 URL,Allow: /admin/public/优于Disallow: /admin/。 - 通配符。
*匹配任意字符序列;$锚定在 URL 末尾。 - 注释以
#开头。 - 与顺序无关。 规则按特异性(路径长度)评估,而非列出顺序。
常见错误
| 错误 | 效果 |
|---|---|
顶部为 Disallow: /,且无 Allow |
整个网站被屏蔽 |
Disallow: *.pdf |
许多解析器会忽略,请使用 Disallow: /*.pdf$ |
| Disallow 中使用协议相对或绝对 URL | 被忽略,路径必须为相对路径 |
规则前有多个 User-agent 行 |
会合并;规则适用于所有列出的 UA |
| 路径末尾的尾随空格 | 会被悄悄视为不同的路径 |
| 将 robots.txt 放入子目录 | 仅获取根域名下的文件 |
robots.txt 与 noindex 的区别
robots.txt 指示爬虫不要抓取某个 URL。一个已被索引、随后在 robots.txt 中被屏蔽的页面可能会在索引中保留数月,因为爬虫无法抓取它以确认移除。若要将其移出索引,请在页面本身使用 noindex 元标签或 HTTP 头,并让爬虫能够看到它。
Crawl-delay
Crawl-delay: 10 请求每次请求之间间隔 10 秒。谷歌会忽略它(请在 Search Console 中设置抓取速率)。必应、Yandex 及部分小众爬虫会遵守它。适用于受小众爬虫抓取压力的小型网站。
Disallow 不能做的事
- 阻止被链接。 其他网站仍可链接到被禁止的 URL,该 URL 会仅以网址形式出现在搜索结果中(没有标题或描述)。
- 阻止页面被访问。 用户仍可访问被 Disallow 的 URL。
- 对所有人隐藏该 URL。 robots.txt 是公开的;在其中列出秘密路径反而会暴露它们。
常见问题
因为 Disallow 阻止的是抓取,而非索引收录。若谷歌已通过链接或站点地图知道该 URL,仍可能在搜索结果中保留该网址。请在页面上添加 noindex 标签,并让谷歌抓取它以确认移除。
可以。请使用带有自定义规则的 User-agent: BadBot 块。请注意,行为不当的机器人会完全忽略 robots.txt,只有守规矩的机器人才会遵守它。
不应该。robots.txt 是公开的,把它列出来等于暴露了位置。请改用身份验证和服务器级别的访问控制。
是的,对路径而言。Disallow: /Admin/ 不会屏蔽 /admin/。请与你 URL 的实际大小写保持一致。
可以。请列出多条 Sitemap: 行,分别指向不同的 XML 站点地图或站点地图索引。
相关工具
坏链检查器
粘贴页面 URL,检查其出站链接中的 404 和其他 HTTP 错误,并显示每个链接的状态码。
HTTP安全头检查器
粘贴 HTTP 响应标头,在浏览器本地检查 HSTS、CSP、点击劫持、MIME、referrer 和跨源策略。
XML 站点地图检查器
在浏览器中检查站点地图 XML,发现解析错误、缺少地址、重复 URL 以及常用站点地图字段值问题。
外部链接提取器
粘贴原始HTML,可选设置基础URL,即可获得代码中所有外部 http/https 链接的干净、去重列表,用于链接审计和SEO审查。
规范URL验证器
粘贴页面的 HTML 并检查其 rel=canonical 标签:是否存在、是否为有效的绝对 URL、是否与页面 URL 一致。
元描述长度检查器
测量元描述的字符数和估算像素宽度,对照编辑参考,并查看桌面端与移动端版式示意。
此工具还提供其他语言版本
- Robots.txt-checker [NL]
- Vérificateur de Robots.txt [FR]
- Verificador de Robots.txt [PT]
- Pemeriksa Robot.txt [ID]
- Robots.txt-Prüfer [DE]
- Verificador de robots.txt [ES]
- เครื่องมือตรวจสอบไฟล์ robots.txt [TH]
- Robots.txtチェッカー [JA]
- Robots.txt-kontroll [SV]
- Trình kiểm tra robots.txt [VI]
- أداة فحص ملف robots.txt [AR]
- Robots.txt 검사기 [KO]
- Sprawdzanie robots.txt [PL]
- Robots.txt Checker [EN]
- Controllore Robots.txt [IT]
- Проверка robots.txt [RU]
- Robots.txt Denetleyici [TR]