Global ToolBox

Robots.txt 生成器

使用可视化规则生成器创建有效的 robots.txt 文件——为各个爬虫设置允许/禁止规则,添加 Sitemap 与 Crawl-delay,然后复制或下载。

🔒 在您的浏览器本地处理

Loading…

使用方法

  1. 选择一个快速开始预设——“允许全部”让所有爬虫索引整个网站,“屏蔽全部”完全屏蔽所有爬虫,或选择“自定义”自行创建规则。
  2. 为每个规则组设置 User-agent(使用 * 代表所有爬虫,或填写特定机器人名称,如 Googlebot),并添加针对目标路径的允许或禁止规则。
  3. 可选择为每个分组设置 Crawl-delay,并添加您的 Sitemap 网址——两者都会自动附加到生成的文件中。
  4. 从预览框复制生成的 robots.txt,或直接下载——然后将文件上传到您域名的根目录(例如 https://example.com/robots.txt)。

功能特点

  • 一键应用“允许全部”与“屏蔽全部”预设,覆盖最常见的场景
  • 可视化规则生成器——添加或删除 User-agent 分组与允许/禁止规则,无需手动编写语法
  • 可选的每分组 Crawl-delay 与 Sitemap 网址字段
  • 实时生成的输出内容,编辑规则时立即更新
  • 100% 在客户端运行——您的规则绝不会离开浏览器

常见问题

robots.txt 文件应该放在哪里?

请上传到您域名的根目录,使其可以通过 https://yourdomain.com/robots.txt 访问。搜索引擎只会在这个确切位置查找该文件。

robots.txt 真的能阻止搜索引擎抓取我的网站吗?

它只是一种请求,并非强制执行。像 Googlebot 这样行为规范的爬虫会遵守它,但恶意或行为不当的机器人完全可以无视它。请不要依赖它来隐藏敏感内容。

User-agent 字段是什么意思?

它指定该规则组适用于哪个爬虫。使用 * 可匹配所有爬虫,或填写特定机器人名称(如 Googlebot 或 Bingbot),为其设置不同于其他爬虫的规则。

我需要添加 Sitemap 这一行吗?

这是选填项,但建议添加——它能引导爬虫找到您的 sitemap.xml,帮助它们更高效地发现您的页面。如果您目前还没有 Sitemap,可以留空该字段。

所有搜索引擎都会遵守 Crawl-delay 吗?

不会。部分爬虫(如 Bing)支持这项设置,但其他爬虫会忽略它(Google 已不再在 robots.txt 中遵守该设置)。若要控制 Google 的抓取速度,请改用 Google Search Console。

相关工具