Robots.txt 生成器

设置你要面向的爬虫,列出要屏蔽的路径和要允许的路径,添加可选的 crawl-delay,并指向你的站点地图,生成器就会组装出格式正确的 robots.txt,供你复制和部署。它会处理精确的行格式和标点,这样你就不必记住语法或 user-agent 的拼写。

如何生成文件

  1. 1

    设置 user-agent

    输入规则适用的爬虫,或保留 * 以面向所有机器人。

  2. 2

    列出要屏蔽的路径

    添加要屏蔽的目录或路径,每行一个,例如 /admin/ 或 /checkout/。

  3. 3

    列出要允许的路径

    添加应保持可抓取的路径,每行一个,以在更宽泛的 Disallow 中设置例外。

  4. 4

    添加站点地图和 crawl-delay

    声明你的站点地图 URL,如有需要,再添加以秒为单位的 crawl-delay。

  5. 5

    复制并部署

    复制生成的文件并放到 https://yourdomain.com/robots.txt,仅限根目录,而非子目录。

常见起始模板

允许所有内容(大多数网站):

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

屏蔽 staging / 管理后台:

User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml

屏蔽 AI 训练爬虫,允许搜索引擎:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

值得了解的 user-agent

User-agent 所有者 用途
Googlebot Google Search 网页索引
Googlebot-Image Google 图片搜索
Google-Extended Google Bard/Gemini 训练(可选择退出)
Bingbot Microsoft Bing 搜索
DuckDuckBot DuckDuckGo DDG 搜索
GPTBot OpenAI ChatGPT / 训练(可选择退出)
ClaudeBot Anthropic Claude 训练(可选择退出)
CCBot Common Crawl 被众多大型语言模型使用的语料库
AhrefsBot Ahrefs SEO 反向链接索引
SemrushBot Semrush SEO 研究
MJ12bot Majestic SEO 研究

AI 训练机器人默认按惯例支持“选择退出”,而非法律强制要求;诚信运营者会遵守相关指令,缺乏诚信者则不会。

路径匹配规则

  • 路径相对于域名根目录,以 / 开头。
  • * 可匹配任意字符。Disallow: /*.pdf$ 会屏蔽所有 PDF 文件。
  • $ 锚定在 URL 末尾。Disallow: /*/trash$ 会屏蔽 /foo/trash,但不会屏蔽 /foo/trashes/...
  • 最长匹配优先。对于该子路径,Allow: /admin/public/ 会覆盖 Disallow: /admin/
  • 路径区分大小写。

robots.txt 无法做到的事

  • 从 Google 中删除页面。 请在该页面本身使用 noindex 元标签。
  • 保护 URL 不被人访问。 robots.txt 是公开的,只是对守规矩爬虫的建议。
  • 限制 Googlebot 的抓取频率。 Google 会忽略 Crawl-delay;请使用 Search Console。
  • 屏蔽无视 robots.txt 的机器人。 垃圾抓取工具不会读取该文件。

部署检查清单

  1. 放到 https://yourdomain.com/robots.txt,仅限根目录。
  2. Content-Type: text/plain 提供(大多数服务器会自动处理)。
  3. 大小:小于 500 KB。Google 会截断更大的文件。
  4. 部署后,在 Google Search Console 的 robots.txt 测试工具中检查抓取到的文件。
  5. 移除 Disallow 时,请注意解除索引可能需要数周。

常见问题

并非必需。没有它,爬虫会默认“允许所有”。如果你有需要屏蔽的内容,staging、管理后台、结账、站内搜索,那就需要一个。

你可以通过 GPTBot、ClaudeBot、CCBot 和 Google-Extended 等 user-agent 块请求它们停止。主流运营方会遵守;缺乏诚信的抓取工具则完全无视。

爬虫比较宽容,未知指令会被忽略。严重错误(HTTP 404 或 500)会被当作“允许所有”。发布前请验证文件。

放在你想覆盖的每个主机的根目录,https://www.example.com/robots.txthttps://example.com/robots.txt 是针对不同主机的独立文件。

不会。你输入的路径仅用于组装文件,不会被保存或记录。

相关工具

此工具还提供其他语言版本