Pular para o conteúdo
SPCXTools

Gerador de Robots.txt

Gere e baixe um arquivo robots.txt personalizado para controlar os rastreadores de mecanismos de busca e bloquear bots de IA.

Roda localmente — os arquivos não saem do seu dispositivo

Carregando ferramenta…

Como usar: Gerador de Robots.txt

  1. 1Escolha uma política padrão para permitir ou bloquear o rastreamento do seu site por todos os mecanismos de busca.
  2. 2Adicione regras personalizadas para user-agents e caminhos específicos (ex.: bloquear o acesso a /admin/ ou /private/).
  3. 3Defina um atraso de rastreamento (crawl delay) opcional para evitar que bots agressivos sobrecarreguem seu servidor.
  4. 4Marque a caixa "Bloquear rastreadores de IA" para adicionar instantaneamente regras que impedem bots de IA comuns de fazer scraping do seu conteúdo.
  5. 5Insira as URLs do seu sitemap, depois copie o código gerado ou baixe o arquivo diretamente para o seu dispositivo.

Um gerador de robots.txt rápido e privado

Gerenciar como os mecanismos de busca e web scrapers interagem com o seu site é essencial para o SEO e o desempenho do servidor. Este gerador de robots.txt oferece uma interface visual para criar, gerenciar e exportar as instruções de rastreamento do seu site sem precisar escrever a sintaxe manualmente.

Como a ferramenta roda diretamente no seu navegador, a estrutura do seu site, caminhos privados e configurações permanecem totalmente confidenciais. Nada do que você digita no gerador é enviado para um servidor. Você obtém um resultado instantâneo e atualizado em tempo real, que pode copiar ou baixar imediatamente.

Principais recursos e funcionalidades

Políticas de acesso padrão: Comece definindo o comportamento base para todos os bots. Você pode optar por permitir tudo (o que é padrão para a maioria dos sites públicos) ou bloquear tudo (útil para ambientes de homologação ou redes privadas).

Diretivas personalizadas: Adicione regras específicas para bots ou caminhos individuais. Você pode bloquear o acesso de todos os rastreadores a diretórios sensíveis como /admin/ ou /search, enquanto permite que bots específicos acessem determinados arquivos.

Bloquear rastreadores de IA: Com o avanço dos grandes modelos de linguagem, muitos donos de sites preferem que seu conteúdo não seja extraído para treinamento de IA. Esta ferramenta inclui um recurso dedicado para adicionar regras no robots.txt que bloqueiam rastreadores de IA. Marcar uma única caixa adiciona instantaneamente as diretivas Disallow: / para os bots de IA mais comuns, incluindo GPTBot, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended e Bytespider.

Atraso de rastreamento: Se o seu servidor sofre com o tráfego intenso de bots automatizados, você pode definir um atraso de rastreamento. Isso gera uma diretiva Crawl-delay, instruindo os bots a aguardarem um número específico de segundos entre as requisições.

Integração de Sitemap: Uma diretiva de sitemap no robots.txt é a maneira mais eficiente de informar aos mecanismos de busca onde encontrar seus sitemaps XML. Você pode colar vários URLs de sitemap (um por linha), e a ferramenta irá formatá-los corretamente e adicioná-los ao final do seu arquivo.

Como criar arquivos robots.txt de forma eficiente

Ao criar arquivos robots.txt, é importante entender como os rastreadores leem as instruções. O arquivo é dividido em blocos, cada um começando com uma declaração User-agent seguida das regras que se aplicam a ele.

  1. Identifique o User-agent: O user-agent é o nome do bot. Usar um asterisco (*) aplica a regra a todos os bots. Se quiser direcionar especificamente para o rastreador de imagens do Google, use Googlebot-Image.
  2. Defina o Caminho: Os caminhos são relativos à raiz do seu domínio e devem começar com uma barra (/). Para bloquear um diretório inteiro, inclua a barra no final (ex.: /private/). Para bloquear um arquivo específico, inclua a extensão (ex.: /data.csv).
  3. Ordem de Precedência: A maioria dos rastreadores modernos busca o bloco de user-agent mais específico que corresponda ao seu nome. Se o Googlebot visitar seu site, ele seguirá as regras específicas em User-agent: Googlebot e ignorará o bloco User-agent: *. Este gerador organiza automaticamente suas regras por user-agent para garantir um resultado limpo e válido.

Entendendo as limitações

Embora um gerador de arquivo robots txt facilite a criação da sintaxe, é fundamental entender o que esse arquivo não pode fazer.

Não é uma medida de segurança. Bloquear um caminho no seu arquivo robots.txt avisa aos bots bem-intencionados para não rastreá-lo, mas scrapers maliciosos ignorarão o arquivo completamente. Além disso, qualquer pessoa pode ler seu arquivo robots.txt acessando-o pelo navegador, o que significa que você está expondo publicamente a localização dos seus diretórios ocultos. Para uma segurança real, use a autenticação adequada e os Códigos de status HTTP apropriados, como 401 Unauthorized ou 403 Forbidden.

Não garante a desindexação. Se uma página for bloqueada no robots.txt, o Google não a rastreará. No entanto, se essa página for linkada em outro lugar na web, o Google ainda poderá indexar a própria URL (geralmente exibindo uma mensagem como "Nenhuma informação está disponível para esta página"). Se o seu objetivo é remover completamente uma página dos resultados dos mecanismos de busca, você deve permitir o rastreamento no robots.txt e, em vez disso, usar uma tag HTML noindex. Você pode gerar as tags corretas usando nosso Gerador de Meta Tags.

Implementação e testes

Após configurar suas regras, clique em download para salvar o arquivo. O arquivo deve ser nomeado exatamente como robots.txt (tudo em letras minúsculas) e enviado para o diretório raiz do seu domínio. Por exemplo, https://yourdomain.com/robots.txt. Se você colocá-lo em uma subpasta, como https://yourdomain.com/assets/robots.txt, os rastreadores não o encontrarão e assumirão que não há restrições.

Perguntas frequentes

O que é um arquivo robots.txt?
Um arquivo robots.txt é um arquivo de texto simples colocado no diretório raiz de um site. Ele fornece instruções para robôs da web (como o Googlebot) sobre quais páginas ou arquivos eles podem ou não acessar no seu site.
Como bloquear crawlers de IA?
Marcar a opção "Bloquear IA" nesta ferramenta adiciona automaticamente regras para bloquear scrapers de dados de IA conhecidos, incluindo GPTBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended e outros. Isso informa a esses bots para não usarem o conteúdo do seu site no treinamento de grandes modelos de linguagem.
O que o crawl delay faz?
A diretiva crawl delay informa aos bots quantos segundos eles devem aguardar entre solicitações sucessivas ao seu servidor. Isso é útil se crawlers agressivos estiverem consumindo muita banda ou deixando seu site lento. Vale notar que nem todos os buscadores (como o Google) respeitam essa diretiva, mas muitos outros sim.
Onde devo colocar o arquivo robots.txt?
Ele deve ser colocado no diretório raiz principal do seu site. Por exemplo, se o seu domínio for example.com, o arquivo deve estar acessível exatamente em https://example.com/robots.txt. Se for colocado em um subdiretório, os crawlers não o encontrarão.
Os dados do meu site são enviados para algum servidor ao usar esta ferramenta?
Não. Este gerador de robots.txt funciona totalmente localmente no seu navegador. Suas regras, caminhos e URLs de sitemap nunca são enviados ou armazenados em nossos servidores.
O robots.txt oculta minhas páginas dos resultados de busca?
Não necessariamente. Embora ele impeça os buscadores de rastrear o conteúdo da página, a URL ainda pode aparecer nos resultados de busca se outros sites tiverem links para ela. Para remover completamente uma página dos índices de busca, você deve usar a meta tag "noindex".