Lompat ke konten
SPCXTools

Generator Robots.txt

Buat dan unduh file robots.txt kustom untuk mengontrol crawler mesin pencari dan memblokir bot AI.

Berjalan secara lokal — file tidak pernah meninggalkan perangkat Anda

Memuat alat…

Cara menggunakan Generator Robots.txt

  1. 1Pilih kebijakan default untuk mengizinkan atau melarang semua mesin pencari merayapi situs Anda.
  2. 2Tambahkan aturan kustom untuk user-agent dan path tertentu (misalnya, larang akses ke /admin/ atau /private/).
  3. 3Atur jeda crawl opsional untuk mencegah bot agresif membebani server Anda.
  4. 4Centang kotak "Blokir crawler AI" untuk langsung menambahkan aturan yang mencegah bot AI umum melakukan scraping pada konten Anda.
  5. 5Masukkan URL sitemap Anda, lalu salin kode yang dihasilkan atau unduh file langsung ke perangkat Anda.

Generator robots.txt yang cepat dan privat

Mengatur cara mesin pencari dan web scraper berinteraksi dengan website Anda sangat penting untuk SEO dan performa server. Generator robots.txt ini menyediakan antarmuka visual untuk membuat, mengelola, dan mengekspor instruksi crawler website Anda tanpa perlu menulis sintaks secara manual.

Karena alat ini beroperasi sepenuhnya di dalam browser, struktur website, path privat, dan konfigurasi Anda dijamin kerahasiaannya. Data apa pun yang Anda masukkan ke dalam generator tidak akan pernah dikirim ke server. Anda akan mendapatkan output instan yang diperbarui secara langsung, yang bisa segera disalin atau diunduh.

Fitur dan kemampuan utama

Kebijakan Akses Default: Mulai dengan menentukan aturan dasar untuk semua bot. Anda bisa memilih untuk mengizinkan semua (standar untuk sebagian besar website publik) atau memblokir semua (berguna untuk lingkungan staging atau jaringan privat).

Direktif Kustom: Tambahkan aturan spesifik untuk bot atau path tertentu. Anda bisa memblokir semua crawler agar tidak mengakses direktori sensitif seperti /admin/ atau /search, sambil tetap mengizinkan bot tertentu mengakses file tertentu.

Blokir Crawler AI: Seiring berkembangnya model bahasa besar (LLM), banyak pemilik website tidak ingin konten mereka di-scrape untuk pelatihan AI. Alat ini memiliki fitur khusus untuk memblokir crawler AI di robots.txt. Cukup centang satu kotak untuk langsung menambahkan direktif Disallow: / bagi bot AI paling umum, termasuk GPTBot, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended, dan Bytespider.

Crawl Delay: Jika server Anda kewalahan menerima trafik tinggi dari bot otomatis, Anda bisa mengatur jeda crawl. Fitur ini akan menghasilkan direktif Crawl-delay, yang menginstruksikan bot untuk menunggu beberapa detik di antara setiap permintaan.

Integrasi Sitemap: Direktif sitemap di robots.txt adalah cara paling efisien untuk memberi tahu mesin pencari lokasi sitemap XML Anda. Anda bisa paste beberapa URL sitemap (satu per baris), dan alat ini akan memformat serta menambahkannya ke bagian bawah file Anda.

Cara membuat file robots.txt yang efektif

Saat membuat file robots.txt, Anda perlu memahami cara crawler membaca instruksinya. File ini dibagi menjadi beberapa blok, masing-masing diawali dengan deklarasi User-agent lalu diikuti oleh aturan yang berlaku untuknya.

  1. Identifikasi User-agent: User-agent adalah nama bot. Menggunakan tanda bintang (*) akan menerapkan aturan ke semua bot. Jika Anda ingin menargetkan crawler gambar Google secara khusus, gunakan Googlebot-Image.
  2. Tentukan Path: Path bersifat relatif terhadap root domain Anda dan harus diawali dengan garis miring (/). Untuk memblokir seluruh direktori, sertakan garis miring di akhir (misalnya, /private/). Untuk memblokir file tertentu, sertakan ekstensinya (misalnya, /data.csv).
  3. Urutan Prioritas: Sebagian besar crawler modern mencari blok user-agent paling spesifik yang sesuai dengan nama mereka. Jika Googlebot mengunjungi situs Anda, ia akan mengikuti aturan khusus di bawah User-agent: Googlebot dan mengabaikan blok User-agent: *. Generator ini secara otomatis menyusun aturan Anda berdasarkan user-agent untuk memastikan hasilnya rapi dan valid.

Memahami keterbatasan

Meskipun generator file robots txt memudahkan penulisan sintaks, Anda harus memahami apa yang tidak bisa dilakukan oleh file ini.

Ini bukan sistem keamanan. Memblokir path di file robots.txt hanya memberi tahu bot yang baik agar tidak merayapinya, tetapi scraper berbahaya akan mengabaikan file ini sepenuhnya. Selain itu, siapa saja bisa membaca file robots.txt Anda dengan mengaksesnya melalui browser, yang berarti Anda mengekspos lokasi direktori tersembunyi Anda ke publik. Untuk keamanan yang sebenarnya, gunakan autentikasi yang tepat dan HTTP Status Codes yang sesuai seperti 401 Unauthorized atau 403 Forbidden.

Ini tidak menjamin de-indexing. Jika sebuah halaman diblokir di robots.txt, Google tidak akan merayapinya. Namun, jika halaman tersebut mendapat tautan dari tempat lain di web, Google mungkin tetap mengindeks URL itu sendiri (sering kali menampilkan pesan seperti "Tidak ada informasi yang tersedia untuk halaman ini"). Jika tujuan Anda adalah menghapus halaman sepenuhnya dari hasil pencarian, Anda harus mengizinkan perayapan di robots.txt dan menggunakan tag HTML noindex. Anda bisa membuat tag yang tepat menggunakan Meta Tag Generator kami.

Penerapan dan pengujian

Setelah Anda mengonfigurasi aturan, klik unduh untuk menyimpan file. File tersebut harus diberi nama persis robots.txt (semua huruf kecil) dan diunggah ke direktori root domain Anda. Sebagai contoh, https://yourdomain.com/robots.txt. Jika Anda menempatkannya di dalam subfolder, seperti https://yourdomain.com/assets/robots.txt, crawler tidak akan menemukannya dan akan menganggap Anda tidak menerapkan batasan apa pun.

Pertanyaan yang sering diajukan

Apa itu file robots.txt?
File robots.txt adalah file teks sederhana yang ditempatkan di direktori root situs web. File ini memberikan instruksi kepada robot web (seperti Googlebot) tentang halaman atau file mana yang boleh atau tidak boleh mereka akses dari situs Anda.
Bagaimana cara memblokir crawler AI?
Mencentang opsi "Block AI" pada alat ini secara otomatis menambahkan aturan untuk memblokir scraper data AI yang dikenal, termasuk GPTBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended, dan lainnya. Hal ini memberi tahu bot tersebut agar tidak menggunakan konten situs web Anda untuk melatih model bahasa besar.
Apa fungsi crawl delay?
Direktif crawl delay memberi tahu bot berapa detik mereka harus menunggu di antara setiap permintaan berurutan ke server Anda. Ini berguna jika crawler agresif menghabiskan terlalu banyak bandwidth atau memperlambat situs web Anda. Perhatikan bahwa tidak semua mesin pencari (seperti Google) mematuhi direktif ini, tetapi banyak mesin pencari lainnya yang mematuhinya.
Di mana saya harus menempatkan file robots.txt?
File ini harus ditempatkan di direktori root tingkat atas situs web Anda. Misalnya, jika domain Anda adalah example.com, file tersebut harus dapat diakses tepat di https://example.com/robots.txt. Jika ditempatkan di subdirektori, crawler tidak akan menemukannya.
Apakah data situs web saya dikirim ke server saat menggunakan alat ini?
Tidak. Generator file robots txt ini berjalan sepenuhnya secara lokal di browser web Anda. Aturan, path, dan URL sitemap Anda tidak pernah diunggah atau disimpan di server kami.
Apakah robots.txt menyembunyikan halaman saya dari hasil pencarian?
Belum tentu. Meskipun mencegah mesin pencari melakukan crawling pada konten halaman, URL tersebut mungkin tetap muncul di hasil pencarian jika ada situs lain yang menautkannya. Untuk benar-benar menghapus halaman dari indeks pencarian, sebaiknya gunakan meta tag "noindex".