可索引性检测器

检查可索引性
下一个

一个页面本身可能完全没问题,却因为某个标签写了 “noindex”,或者 robots.txt 拦住了爬虫,而在搜索结果中彻底隐身。粘贴一个 URL,这个检测器会评估 Google 使用的每一个信号,robots.txt、meta robots、X-Robots-Tag 响应头、canonical 目标、HTTP 状态码,并告诉你这个页面是否可被索引、原因是什么,以及如果不可索引该改哪里。

如何检查可索引性

  1. 1

    输入一个 URL

    检测器会像 Googlebot 一样抓取这个 URL。

  2. 2

    解析跳转

    会追踪 301/302 跳转链条;最终落地的 URL 才是被评估的那一个。

  3. 3

    读取每一个可索引性信号

    robots.txt 规则、meta robots、X-Robots-Tag、canonical、状态码。

  4. 4

    结论与原因

    可索引/不可索引/部分可索引,并指出导致该结论的确切信号。

可索引性信号及其优先级

Google 会按特定顺序评估一组信号;链条中只要出现一个否定,就足以阻止索引。

信号评估顺序

  1. HTTP 状态码:必须是 2xx。3xx 链条会被跟随;4xx 和 5xx 终止索引。
  2. robots.txt:如果该 URL 对 Googlebot 被 disallow,页面就永远不会被抓取,也就意味着页面上的 noindex 标签永远不会被看到。
  3. X-Robots-Tag 响应头:HTTP 响应头中的 noindex 会阻止索引。
  4. Meta robots<meta name="robots" content="noindex"> 会阻止索引。
  5. Canonical:指向别处的 canonical 意味着 Google 会改为索引那个 URL。
  6. 内容质量与重复检测:即便没有任何显式指令,Google 也可能跳过索引。

这个工具能抓出的常见错误

问题 原因
整个版块未被索引 robots.txt 中的 Disallow: 规则
某个特定页面未被索引 meta robots 中的 noindex
被索引但 URL 不对 Canonical 指向了别处
卡在 5xx 服务器错误中断了抓取
Disallow + noindex 冲突 robots.txt 拦住抓取,noindex 标签永远读不到
预发布环境泄漏到生产环境 来自测试环境残留的 X-Robots-Tag: noindex

robots.txt + noindex 的陷阱

如果你在 robots.txt 中对某个 URL 设置 Disallow:,Google 就永远不会抓取它,于是也永远看不到任何 noindex 标签。这个 URL 可能仍会作为一条 “空白” 条目出现在搜索结果里,只有 URL 没有描述。要正确地把一个 URL 从索引中移除,应当先允许抓取并使用 noindex,等 Google 真正取消收录之后再去屏蔽抓取。

从 Googlebot 的视角测试

检测器会发送 Googlebot 的 user agent,因此任何 “只对爬虫展示 X” 的服务端把戏都会暴露出来。请始终验证生产环境的 URL,而不是预发布环境。

常见问题

可索引只意味着没有技术上的阻断,并不保证一定会被收录。Google 还会根据它判断的质量、重复内容以及抓取预算来决定。想要 Google 本身给出的确切答案,请使用 Search Console 的 URL 检查工具。

通常只用 meta robots(或 X-Robots-Tag)才是正确做法。robots.txt 阻止抓取;meta robots 阻止索引。对于你不想被索引的页面,应允许抓取,这样 Google 才能读到你的 noindex 标签。

Google 评估的是跳转链条的最终落地页。从 A 到 B 的 301 意味着 Google 最终索引的是 B,而不是 A。检测器通过在评估前解析所有跳转来模拟这一过程。

不能。需要身份验证的页面按定义就是不可索引的。如果你需要为它们做 SEO,可以考虑提供一个公开的预览版本。

相关工具

此工具还提供其他语言版本