Saltar al contenido
SPCXTools

Generador de robots.txt

Genera y descarga un archivo robots.txt personalizado para controlar los rastreadores de los motores de búsqueda y bloquear bots de IA.

Funciona en local: los archivos no salen de tu dispositivo

Cargando herramienta…

Cómo usar Generador de robots.txt

  1. 1Elige una política predeterminada para permitir o bloquear el rastreo de tu sitio a todos los motores de búsqueda.
  2. 2Añade reglas personalizadas para user-agents y rutas específicas (por ejemplo, bloquear el acceso a /admin/ o /private/).
  3. 3Establece un retraso de rastreo opcional para evitar que bots agresivos sobrecarguen tu servidor.
  4. 4Marca la casilla "Bloquear rastreadores de IA" para añadir al instante reglas que eviten que los bots de IA más comunes extraigan tu contenido.
  5. 5Introduce las URL de tus sitemaps y luego copia el código generado o descarga el archivo directamente en tu dispositivo.

Un generador de robots.txt rápido y privado

Gestionar cómo los motores de búsqueda y los rastreadores web interactúan con tu sitio web es fundamental para el SEO y el rendimiento del servidor. Este generador de robots.txt ofrece una interfaz visual para crear, gestionar y exportar las instrucciones de rastreo de tu sitio sin escribir la sintaxis a mano.

Como la herramienta funciona completamente en tu navegador, la estructura de tu sitio, las rutas privadas y las configuraciones se mantienen totalmente confidenciales. Nada de lo que introduzcas en el generador se envía a un servidor. Obtienes un resultado instantáneo y actualizado en tiempo real que puedes copiar o descargar de inmediato.

Características y funciones principales

Políticas de acceso predeterminadas: Empieza definiendo el comportamiento base para todos los bots. Puedes optar por permitir todo (lo estándar en la mayoría de sitios web públicos) o denegar todo (útil para entornos de pruebas o redes privadas).

Directivas personalizadas: Añade reglas específicas para bots o rutas individuales. Puedes bloquear el acceso de todos los rastreadores a directorios sensibles como /admin/ o /search, y a la vez permitir que bots específicos accedan a ciertos archivos.

Bloquear rastreadores de IA: Con el auge de los grandes modelos de lenguaje, muchos propietarios de sitios web prefieren que su contenido no sea extraído para entrenar inteligencia artificial. Esta herramienta incluye una función dedicada para bloquear rastreadores de IA mediante reglas en el archivo robots.txt. Al marcar una sola casilla, se añaden al instante directivas Disallow: / para los bots de IA más comunes, incluyendo GPTBot, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended y Bytespider.

Retraso de rastreo: Si tu servidor se sobrecarga por el alto tráfico de bots automatizados, puedes configurar un retraso de rastreo. Esto genera una directiva Crawl-delay, indicando a los bots que esperen un número específico de segundos entre solicitudes.

Integración de Sitemap: Una directiva de sitemap en el robots.txt es la forma más eficiente de indicar a los motores de búsqueda dónde encontrar tus sitemaps XML. Puedes pegar varias URL de sitemaps (una por línea) y la herramienta las formateará y añadirá correctamente al final de tu archivo.

Cómo crear archivos robots.txt de forma efectiva

Al crear archivos robots.txt, es importante entender cómo los rastreadores leen las instrucciones. El archivo se divide en bloques, y cada uno comienza con una declaración User-agent seguida de las reglas que se le aplican.

  1. Identifica el User-agent: El user-agent es el nombre del bot. Usar un asterisco (*) aplica la regla a todos los bots. Si quieres dirigirte específicamente al rastreador de imágenes de Google, usarías Googlebot-Image.
  2. Define la ruta: Las rutas son relativas a la raíz de tu dominio y deben comenzar con una barra inclinada (/). Para bloquear un directorio completo, incluye la barra al final (p. ej., /private/). Para bloquear un archivo específico, incluye la extensión (p. ej., /data.csv).
  3. Orden de prioridad: La mayoría de los rastreadores modernos buscan el bloque user-agent más específico que coincida con su nombre. Si Googlebot visita tu sitio, seguirá las reglas específicas bajo User-agent: Googlebot e ignorará el bloque User-agent: *. Este generador organiza automáticamente tus reglas por user-agent para asegurar que el resultado sea limpio y válido.

Entender las limitaciones

Aunque un generador de archivos robots txt facilita la escritura de la sintaxis, es crucial entender lo que este archivo no puede hacer.

No es una medida de seguridad. Bloquear una ruta en tu archivo robots.txt indica a los bots respetuosos que no la rastreen, pero los scrapers maliciosos ignorarán el archivo por completo. Además, cualquiera puede leer tu archivo robots.txt accediendo a él desde su navegador, lo que significa que estás revelando públicamente la ubicación de tus directorios ocultos. Para una verdadera seguridad, utiliza una autenticación adecuada y los códigos de estado HTTP apropiados, como 401 Unauthorized o 403 Forbidden.

No garantiza la desindexación. Si una página está bloqueada en el robots.txt, Google no la rastreará. Sin embargo, si esa página está enlazada desde otro lugar de la web, Google podría indexar la URL de todos modos (a menudo mostrando un mensaje como "No hay información disponible sobre esta página"). Si tu objetivo es eliminar por completo una página de los resultados de los motores de búsqueda, debes permitir su rastreo en el robots.txt y usar en su lugar una etiqueta HTML noindex. Puedes generar las etiquetas correctas utilizando nuestro Generador de metaetiquetas.

Despliegue y pruebas

Una vez que hayas configurado tus reglas, haz clic en descargar para guardar el archivo. El archivo debe llamarse exactamente robots.txt (todo en minúsculas) y subirse al directorio raíz de tu dominio. Por ejemplo, https://yourdomain.com/robots.txt. Si lo colocas en una subcarpeta, como https://yourdomain.com/assets/robots.txt, los rastreadores no lo encontrarán y asumirán que no tienes restricciones.

Preguntas frecuentes

¿Qué es un archivo robots.txt?
Un archivo robots.txt es un archivo de texto simple que se coloca en el directorio raíz de un sitio web. Proporciona instrucciones a los robots web (como Googlebot) sobre qué páginas o archivos pueden o no solicitar de tu sitio.
¿Cómo bloqueo los rastreadores de IA?
Al marcar la opción "Bloquear IA" en esta herramienta, se añaden automáticamente reglas para bloquear a los scrapers de datos de IA conocidos, incluyendo GPTBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended y otros. Esto indica a estos bots que no utilicen el contenido de tu sitio web para entrenar grandes modelos de lenguaje.
¿Para qué sirve el retraso de rastreo?
La directiva de retraso de rastreo (crawl delay) indica a los bots cuántos segundos deben esperar entre solicitudes sucesivas a tu servidor. Esto es útil si los rastreadores agresivos consumen demasiado ancho de banda o ralentizan tu sitio web. Ten en cuenta que no todos los motores de búsqueda (como Google) respetan esta directiva, pero muchos otros sí.
¿Dónde debo colocar el archivo robots.txt?
Debe colocarse en el directorio raíz de tu sitio web. Por ejemplo, si tu dominio es example.com, el archivo debe ser accesible exactamente en https://example.com/robots.txt. Si se coloca en un subdirectorio, los rastreadores no lo encontrarán.
¿Se envían los datos de mi sitio web a un servidor al usar esta herramienta?
No. Este generador de archivos robots.txt se ejecuta de forma totalmente local en tu navegador web. Tus reglas, rutas y las URL del sitemap nunca se suben ni se almacenan en nuestros servidores.
¿El archivo robots.txt oculta mis páginas de los resultados de búsqueda?
No necesariamente. Aunque impide que los motores de búsqueda rastreen el contenido de la página, la URL podría seguir apareciendo en los resultados de búsqueda si otros sitios la enlazan. Para eliminar por completo una página de los índices de búsqueda, debes usar una etiqueta meta "noindex".