Ein schneller, privater robots.txt Generator
Es ist für SEO und Server-Performance entscheidend zu steuern, wie Suchmaschinen und Web-Scraper mit Ihrer Website interagieren. Dieser robots.txt Generator bietet eine visuelle Benutzeroberfläche, mit der Sie die Crawler-Anweisungen Ihrer Website erstellen, verwalten und exportieren können, ohne die Syntax manuell schreiben zu müssen.
Da das Tool komplett in Ihrem Browser ausgeführt wird, bleiben Ihre Website-Struktur, private Pfade und Konfigurationen absolut vertraulich. Keine Ihrer Eingaben wird jemals an einen Server gesendet. Sie erhalten eine sich in Echtzeit aktualisierende Ausgabe, die Sie sofort kopieren oder herunterladen können.
Hauptfunktionen und Features
Standard-Zugriffsrichtlinien: Legen Sie zunächst das grundlegende Verhalten für alle Bots fest. Sie können alles erlauben (Standard für die meisten öffentlichen Websites) oder alles verbieten (nützlich für Staging-Umgebungen oder private Netzwerke).
Benutzerdefinierte Direktiven: Fügen Sie spezifische Regeln für einzelne Bots oder Pfade hinzu. Sie können alle Crawler für sensible Verzeichnisse wie /admin/ oder /search blockieren, während Sie bestimmten Bots den Zugriff auf ausgewählte Dateien erlauben.
KI-Crawler blockieren: Mit dem Aufstieg großer Sprachmodelle möchten viele Website-Betreiber nicht, dass ihre Inhalte für KI-Training gescrapt werden. Dieses Tool bietet eine spezielle Funktion, um KI-Crawler über robots.txt-Regeln zu blockieren. Ein einziges Häkchen fügt sofort Disallow: /-Direktiven für die häufigsten KI-Bots hinzu, darunter GPTBot, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended und Bytespider.
Crawl-Verzögerung: Wenn Ihr Server unter hohem Traffic durch automatisierte Bots leidet, können Sie eine Crawl-Verzögerung festlegen. Dies erzeugt eine Crawl-delay-Direktive, die Bots anweist, eine bestimmte Anzahl von Sekunden zwischen den Anfragen zu warten.
Sitemap-Integration: Eine Sitemap-Direktive in der robots.txt ist der effizienteste Weg, Suchmaschinen mitzuteilen, wo sie Ihre XML-Sitemaps finden. Sie können mehrere Sitemap-URLs einfügen (eine pro Zeile), und das Tool wird sie korrekt formatieren und am Ende Ihrer Datei anfügen.
robots.txt-Dateien effektiv erstellen
Beim Erstellen von robots.txt-Dateien ist es wichtig zu verstehen, wie Crawler die Anweisungen lesen. Die Datei ist in Blöcke unterteilt. Jeder Block beginnt mit einer User-agent-Deklaration, gefolgt von den entsprechenden Regeln.
- User-agent bestimmen: Der User-agent ist der Name des Bots. Ein Sternchen (
*) wendet die Regel auf alle Bots an. Um gezielt den Bild-Crawler von Google anzusprechen, verwenden SieGooglebot-Image. - Pfad definieren: Pfade sind relativ zum Stammverzeichnis Ihrer Domain und müssen mit einem Schrägstrich (
/) beginnen. Um ein komplettes Verzeichnis zu sperren, fügen Sie den abschließenden Schrägstrich hinzu (z. B./private/). Um eine bestimmte Datei zu sperren, geben Sie die Dateiendung an (z. B./data.csv). - Rangfolge: Die meisten modernen Crawler suchen nach dem spezifischsten User-agent-Block, der zu ihrem Namen passt. Besucht der Googlebot Ihre Website, folgt er den spezifischen Regeln unter
User-agent: Googlebotund ignoriert den BlockUser-agent: *. Dieser Generator ordnet Ihre Regeln automatisch nach User-agent, um eine saubere und valide Ausgabe zu gewährleisten.
Die Grenzen verstehen
Ein Robots.txt-Generator macht es zwar einfach, die richtige Syntax zu erstellen, aber es ist wichtig zu verstehen, was diese Datei nicht leisten kann.
Sie ist keine Sicherheitsmaßnahme. Wenn Sie einen Pfad in Ihrer robots.txt-Datei sperren, weist das seriöse Bots an, diesen nicht zu crawlen. Bösartige Scraper ignorieren die Datei jedoch völlig. Zudem kann jeder Ihre robots.txt-Datei im Browser aufrufen. Das bedeutet, dass Sie den Speicherort Ihrer versteckten Verzeichnisse öffentlich preisgeben. Für echte Sicherheit sollten Sie eine richtige Authentifizierung und passende HTTP-Statuscodes wie 401 Unauthorized oder 403 Forbidden verwenden.
Sie garantiert keine Deindexierung. Wenn eine Seite in der robots.txt gesperrt ist, wird Google sie nicht crawlen. Wenn diese Seite jedoch von einer anderen Website verlinkt wird, indexiert Google die URL möglicherweise trotzdem (oft mit dem Hinweis "Für diese Seite sind keine Informationen verfügbar"). Wenn Sie eine Seite vollständig aus den Suchergebnissen entfernen möchten, sollten Sie das Crawling in der robots.txt zulassen und stattdessen ein noindex-HTML-Tag verwenden. Die passenden Tags können Sie mit unserem Meta Tag Generator erstellen.
Bereitstellung und Testen
Sobald Sie Ihre Regeln konfiguriert haben, klicken Sie auf Download, um die Datei zu speichern. Die Datei muss genau robots.txt (alles kleingeschrieben) heißen und in das Hauptverzeichnis Ihrer Domain hochgeladen werden. Zum Beispiel: https://yourdomain.com/robots.txt. Wenn Sie die Datei in einem Unterordner ablegen, z. B. https://yourdomain.com/assets/robots.txt, können Crawler sie nicht finden und gehen davon aus, dass keine Einschränkungen gelten.