快速、私密的 robots.txt 生成器
管理搜索引擎和网络爬虫与网站的交互方式,对 SEO 和服务器性能至关重要。这款 robots.txt 生成器提供直观的可视化界面,让您无需手动编写语法规则,即可轻松创建、管理和导出网站的爬虫指令。
由于该工具完全在您的浏览器中运行,您的网站结构、私密路径和配置信息将得到绝对保密。您输入的任何内容都不会被发送到服务器。结果会实时更新,您可以立即复制或下载生成的文件。
核心功能与特性
默认访问策略: 首先为所有爬虫定义基础访问规则。您可以选择允许所有抓取(大多数公开网站的标准做法),或禁止所有抓取(适用于测试环境或私有网络)。
自定义指令: 针对特定爬虫或路径添加专属规则。您可以禁止所有爬虫访问 /admin/ 或 /search 等敏感目录,同时允许特定爬虫访问某些文件。
屏蔽 AI 爬虫: 随着大语言模型的兴起,许多网站所有者不希望自己的内容被抓取用于 AI 训练。本工具内置了屏蔽 AI 爬虫的专属 robots.txt 规则功能。只需勾选一个复选框,即可立即为最常见的 AI 爬虫(包括 GPTBot、ClaudeBot、PerplexityBot、Google-Extended、Applebot-Extended 和 Bytespider)添加 Disallow: / 指令。
抓取延迟: 如果您的服务器难以承受自动化爬虫带来的巨大流量,可以设置抓取延迟。这会生成 Crawl-delay 指令,要求爬虫在两次请求之间等待指定的秒数。
集成站点地图(Sitemap): 在 robots.txt 中添加 sitemap 指令,是告诉搜索引擎去哪里查找 XML 站点地图的最有效方式。您可以粘贴多个站点地图 URL(每行一个),工具会自动将其格式化并附加到文件底部。
如何高效创建 robots.txt 文件
在创建 robots.txt 文件时,了解爬虫如何读取指令非常重要。该文件分为多个区块,每个区块以 User-agent 声明开头,其后是适用于该爬虫的规则。
- 确定 User-agent: User-agent 即爬虫的名称。使用星号 (
*) 可将规则应用于所有爬虫。如果您想专门针对 Google 的图片爬虫,可以使用Googlebot-Image。 - 定义路径: 路径是相对于网站根目录的,且必须以正斜杠 (
/) 开头。要屏蔽整个目录,请在末尾加上斜杠(例如/private/)。要屏蔽特定文件,请包含文件扩展名(例如/data.csv)。 - 优先级: 大多数现代爬虫会寻找与其名称最精确匹配的 User-agent 区块。如果 Googlebot 访问您的网站,它将专门遵循
User-agent: Googlebot下的规则,并忽略User-agent: *区块。本生成器会自动按 User-agent 整理您的规则,确保输出结果规范有效。
了解其局限性
虽然 robots.txt 生成器让编写语法变得简单,但了解该文件无法实现的功能至关重要。
它不是安全措施。 在 robots.txt 文件中禁止抓取某个路径,只能告诉合规的爬虫不要访问,但恶意爬虫会完全无视该文件。此外,任何人都可以通过浏览器直接查看你的 robots.txt 文件,这意味着你实际上是在公开暴露隐藏目录的位置。为了确保真正的安全,请使用正确的身份验证机制以及相应的 HTTP 状态码(如 401 Unauthorized 或 403 Forbidden)。
它无法保证网页不被索引。 如果 robots.txt 中禁止了某个页面,Google 就不会抓取该页面。但是,如果网络上其他地方存在指向该页面的链接,Google 仍可能会索引该 URL 本身(通常会在搜索结果中显示“此网页没有可用的信息”之类的提示)。如果你的目标是将网页从搜索引擎结果中彻底移除,则应在 robots.txt 中允许抓取,并改用 noindex HTML 标签。你可以使用我们的 Meta 标签生成器 来生成正确的标签。
部署与测试
规则配置完成后,点击下载保存文件。文件必须准确命名为 robots.txt(全部小写),并上传至网站根目录。例如:https://yourdomain.com/robots.txt。如果将其放置在子目录中(例如 https://yourdomain.com/assets/robots.txt),爬虫将无法找到该文件,并会默认您的网站没有设置任何抓取限制。