跳到正文
SPCXTools

Robots.txt 生成器

生成并下载自定义 robots.txt 文件,控制搜索引擎爬虫并屏蔽 AI 爬虫。

本地运行——文件不会离开你的设备

正在加载工具…

如何使用Robots.txt 生成器

  1. 1选择默认策略,允许或禁止所有搜索引擎抓取您的网站。
  2. 2为特定的 User-Agent 和路径添加自定义规则(例如,禁止访问 /admin/ 或 /private/)。
  3. 3设置可选的抓取延迟,防止激进的爬虫导致服务器过载。
  4. 4勾选“屏蔽 AI 爬虫”选项,立即添加规则以防止常见的 AI 爬虫抓取您的内容。
  5. 5输入您的站点地图 URL,然后复制生成的代码或将文件直接下载到您的设备。

快速、私密的 robots.txt 生成器

管理搜索引擎和网络爬虫与网站的交互方式,对 SEO 和服务器性能至关重要。这款 robots.txt 生成器提供直观的可视化界面,让您无需手动编写语法规则,即可轻松创建、管理和导出网站的爬虫指令。

由于该工具完全在您的浏览器中运行,您的网站结构、私密路径和配置信息将得到绝对保密。您输入的任何内容都不会被发送到服务器。结果会实时更新,您可以立即复制或下载生成的文件。

核心功能与特性

默认访问策略: 首先为所有爬虫定义基础访问规则。您可以选择允许所有抓取(大多数公开网站的标准做法),或禁止所有抓取(适用于测试环境或私有网络)。

自定义指令: 针对特定爬虫或路径添加专属规则。您可以禁止所有爬虫访问 /admin/ 或 /search 等敏感目录,同时允许特定爬虫访问某些文件。

屏蔽 AI 爬虫: 随着大语言模型的兴起,许多网站所有者不希望自己的内容被抓取用于 AI 训练。本工具内置了屏蔽 AI 爬虫的专属 robots.txt 规则功能。只需勾选一个复选框,即可立即为最常见的 AI 爬虫(包括 GPTBot、ClaudeBot、PerplexityBot、Google-Extended、Applebot-Extended 和 Bytespider)添加 Disallow: / 指令。

抓取延迟: 如果您的服务器难以承受自动化爬虫带来的巨大流量,可以设置抓取延迟。这会生成 Crawl-delay 指令,要求爬虫在两次请求之间等待指定的秒数。

集成站点地图(Sitemap): 在 robots.txt 中添加 sitemap 指令,是告诉搜索引擎去哪里查找 XML 站点地图的最有效方式。您可以粘贴多个站点地图 URL(每行一个),工具会自动将其格式化并附加到文件底部。

如何高效创建 robots.txt 文件

在创建 robots.txt 文件时,了解爬虫如何读取指令非常重要。该文件分为多个区块,每个区块以 User-agent 声明开头,其后是适用于该爬虫的规则。

  1. 确定 User-agent: User-agent 即爬虫的名称。使用星号 (*) 可将规则应用于所有爬虫。如果您想专门针对 Google 的图片爬虫,可以使用 Googlebot-Image。
  2. 定义路径: 路径是相对于网站根目录的,且必须以正斜杠 (/) 开头。要屏蔽整个目录,请在末尾加上斜杠(例如 /private/)。要屏蔽特定文件,请包含文件扩展名(例如 /data.csv)。
  3. 优先级: 大多数现代爬虫会寻找与其名称最精确匹配的 User-agent 区块。如果 Googlebot 访问您的网站,它将专门遵循 User-agent: Googlebot 下的规则,并忽略 User-agent: * 区块。本生成器会自动按 User-agent 整理您的规则,确保输出结果规范有效。

了解其局限性

虽然 robots.txt 生成器让编写语法变得简单,但了解该文件无法实现的功能至关重要。

它不是安全措施。 在 robots.txt 文件中禁止抓取某个路径,只能告诉合规的爬虫不要访问,但恶意爬虫会完全无视该文件。此外,任何人都可以通过浏览器直接查看你的 robots.txt 文件,这意味着你实际上是在公开暴露隐藏目录的位置。为了确保真正的安全,请使用正确的身份验证机制以及相应的 HTTP 状态码(如 401 Unauthorized 或 403 Forbidden)。

它无法保证网页不被索引。 如果 robots.txt 中禁止了某个页面,Google 就不会抓取该页面。但是,如果网络上其他地方存在指向该页面的链接,Google 仍可能会索引该 URL 本身(通常会在搜索结果中显示“此网页没有可用的信息”之类的提示)。如果你的目标是将网页从搜索引擎结果中彻底移除,则应在 robots.txt 中允许抓取,并改用 noindex HTML 标签。你可以使用我们的 Meta 标签生成器 来生成正确的标签。

部署与测试

规则配置完成后,点击下载保存文件。文件必须准确命名为 robots.txt(全部小写),并上传至网站根目录。例如:https://yourdomain.com/robots.txt。如果将其放置在子目录中(例如 https://yourdomain.com/assets/robots.txt),爬虫将无法找到该文件,并会默认您的网站没有设置任何抓取限制。

常见问题

什么是 robots.txt 文件?
robots.txt 是一个放在网站根目录下的简单文本文件。它向网络爬虫(如 Googlebot)提供指令,告知它们可以或不可以抓取网站上的哪些页面或文件。
如何屏蔽 AI 爬虫?
勾选此工具中的“屏蔽 AI”选项,会自动添加规则以禁止已知的 AI 数据抓取工具,包括 GPTBot、ChatGPT-User、ClaudeBot、PerplexityBot、Google-Extended 等。这会告知这些爬虫不要使用您的网站内容来训练大型语言模型。
抓取延迟(crawl delay)有什么作用?
抓取延迟指令告诉爬虫在连续请求您的服务器之间应该等待多少秒。如果激进的爬虫消耗了过多带宽或导致您的网站变慢,此功能非常有用。请注意,并非所有搜索引擎(如 Google)都遵守此指令,但许多其他搜索引擎会遵守。
我应该将 robots.txt 文件放在哪里?
它必须放在您网站的顶级根目录中。例如,如果您的域名是 example.com,则该文件必须可以通过 https://example.com/robots.txt 准确访问。如果放在子目录中,爬虫将无法找到它。
使用此工具时,我的网站数据会发送到服务器吗?
不会。此 robots.txt 生成器完全在您的浏览器中本地运行。您的规则、路径和站点地图(sitemap)URL 绝不会上传或存储在我们的服务器上。
robots.txt 能让我的网页在搜索结果中隐藏吗?
不一定。虽然它可以阻止搜索引擎抓取网页内容,但如果有其他网站链接到该网页,其 URL 仍可能出现在搜索结果中。要彻底将网页从搜索索引中移除,您应该使用 "noindex" meta 标签。