Robots.txt 生成器
设置你要面向的爬虫,列出要屏蔽的路径和要允许的路径,添加可选的 crawl-delay,并指向你的站点地图,生成器就会组装出格式正确的 robots.txt,供你复制和部署。它会处理精确的行格式和标点,这样你就不必记住语法或 user-agent 的拼写。
如何生成文件
-
1
设置 user-agent
输入规则适用的爬虫,或保留 * 以面向所有机器人。
-
2
列出要屏蔽的路径
添加要屏蔽的目录或路径,每行一个,例如 /admin/ 或 /checkout/。
-
3
列出要允许的路径
添加应保持可抓取的路径,每行一个,以在更宽泛的 Disallow 中设置例外。
-
4
添加站点地图和 crawl-delay
声明你的站点地图 URL,如有需要,再添加以秒为单位的 crawl-delay。
-
5
复制并部署
复制生成的文件并放到 https://yourdomain.com/robots.txt,仅限根目录,而非子目录。
常见起始模板
允许所有内容(大多数网站):
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
屏蔽 staging / 管理后台:
User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml
屏蔽 AI 训练爬虫,允许搜索引擎:
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
值得了解的 user-agent
| User-agent | 所有者 | 用途 |
|---|---|---|
| Googlebot | Google Search | 网页索引 |
| Googlebot-Image | 图片搜索 | |
| Google-Extended | Bard/Gemini 训练(可选择退出) | |
| Bingbot | Microsoft | Bing 搜索 |
| DuckDuckBot | DuckDuckGo | DDG 搜索 |
| GPTBot | OpenAI | ChatGPT / 训练(可选择退出) |
| ClaudeBot | Anthropic | Claude 训练(可选择退出) |
| CCBot | Common Crawl | 被众多大型语言模型使用的语料库 |
| AhrefsBot | Ahrefs | SEO 反向链接索引 |
| SemrushBot | Semrush | SEO 研究 |
| MJ12bot | Majestic | SEO 研究 |
AI 训练机器人默认按惯例支持“选择退出”,而非法律强制要求;诚信运营者会遵守相关指令,缺乏诚信者则不会。
路径匹配规则
- 路径相对于域名根目录,以
/开头。 *可匹配任意字符。Disallow: /*.pdf$会屏蔽所有 PDF 文件。$锚定在 URL 末尾。Disallow: /*/trash$会屏蔽/foo/trash,但不会屏蔽/foo/trashes/...。- 最长匹配优先。对于该子路径,
Allow: /admin/public/会覆盖Disallow: /admin/。 - 路径区分大小写。
robots.txt 无法做到的事
- 从 Google 中删除页面。 请在该页面本身使用
noindex元标签。 - 保护 URL 不被人访问。 robots.txt 是公开的,只是对守规矩爬虫的建议。
- 限制 Googlebot 的抓取频率。 Google 会忽略
Crawl-delay;请使用 Search Console。 - 屏蔽无视 robots.txt 的机器人。 垃圾抓取工具不会读取该文件。
部署检查清单
- 放到
https://yourdomain.com/robots.txt,仅限根目录。 - 以
Content-Type: text/plain提供(大多数服务器会自动处理)。 - 大小:小于 500 KB。Google 会截断更大的文件。
- 部署后,在 Google Search Console 的 robots.txt 测试工具中检查抓取到的文件。
- 移除 Disallow 时,请注意解除索引可能需要数周。
常见问题
并非必需。没有它,爬虫会默认“允许所有”。如果你有需要屏蔽的内容,staging、管理后台、结账、站内搜索,那就需要一个。
你可以通过 GPTBot、ClaudeBot、CCBot 和 Google-Extended 等 user-agent 块请求它们停止。主流运营方会遵守;缺乏诚信的抓取工具则完全无视。
爬虫比较宽容,未知指令会被忽略。严重错误(HTTP 404 或 500)会被当作“允许所有”。发布前请验证文件。
放在你想覆盖的每个主机的根目录,https://www.example.com/robots.txt 和 https://example.com/robots.txt 是针对不同主机的独立文件。
不会。你输入的路径仅用于组装文件,不会被保存或记录。
相关工具
ASCII 表参考
完整 ASCII 表,覆盖 0 到 127;列出每个代码的十进制、十六进制、八进制、二进制值和 HTML 数字字符引用写法,包括 NUL、LF、DEL。
HTML 字符参考
可搜索的 HTML 实体列表,含命名代码与数值代码,并支持一键复制特殊字符和符号。
键盘快捷键参考
搜索 macOS、Windows 和 Linux 上 VS Code、Chrome 以及使用 GNU Readline 的 Bash 的文档默认快捷键。
邮箱验证器
验证邮箱地址:RFC 5322 语法检查、实时 MX 记录查询,并显示本地部分、域名和长度详情。不会发送任何邮件。
EditorConfig 生成器
按你的缩进、换行符和字符集规则生成 .editorconfig,再为仓库里的每种语言加上正确的区块:Python、Go、YAML、Makefile 等等。
证书解码器
粘贴一张 X.509 PEM 证书,并查看解码后的字段:主体、颁发者、序列号、签名算法、有效期及主体备用名称(SAN)。
此工具还提供其他语言版本
- Robots.txt-generator [NL]
- Générateur de Robots.txt [FR]
- مولد ملفات robots.txt [AR]
- Generator robots.txt [PL]
- Generator Robots.txt [ID]
- Robots.txt-Generator [DE]
- Generador de Robots.txt [ES]
- เครื่องมือสร้างไฟล์ robots.txt [TH]
- Robots.txtジェネレーター [JA]
- Robots.txt-generator [SV]
- Bộ tạo file robots.txt [VI]
- Robots.txt 생성기 [KO]
- Gerador de Robots.txt [PT]
- Генератор robots.txt [RU]
- Robots.txt Oluşturucu [TR]
- Robots.txt Generator [EN]
- Generatore di Robots.txt [IT]