Vai al contenuto
SPCXTools

Generatore di Robots.txt

Genera e scarica un file robots.txt personalizzato per controllare i crawler dei motori di ricerca e bloccare i bot IA.

Funziona localmente: i file non lasciano mai il tuo dispositivo

Caricamento strumento…

Come usare Generatore di Robots.txt

  1. 1Scegli una regola predefinita per consentire o bloccare la scansione del tuo sito da parte di tutti i motori di ricerca.
  2. 2Aggiungi regole personalizzate per user-agent e percorsi specifici (es. blocca l'accesso a /admin/ o /private/).
  3. 3Imposta un crawl delay opzionale per evitare che bot aggressivi sovraccarichino il tuo server.
  4. 4Spunta la casella "Blocca crawler IA" per aggiungere all'istante regole che impediscono ai comuni bot IA di fare scraping dei tuoi contenuti.
  5. 5Inserisci gli URL delle tue sitemap, quindi copia il codice generato o scarica il file direttamente sul tuo dispositivo.

Un generatore di robots.txt veloce e privato

Gestire l'interazione di motori di ricerca e web scraper con il tuo sito è fondamentale per la SEO e le prestazioni del server. Questo generatore di robots.txt offre un'interfaccia visiva per creare, gestire ed esportare le istruzioni per i crawler del tuo sito, senza dover scrivere la sintassi a mano.

Poiché lo strumento funziona interamente nel tuo browser, la struttura del sito, i percorsi privati e le configurazioni restano assolutamente riservati. Nessun dato inserito nel generatore viene mai inviato a un server. Ottieni un risultato istantaneo, aggiornato in tempo reale, pronto da copiare o scaricare subito.

Funzionalità principali

Regole di accesso predefinite: Inizia definendo il comportamento di base per tutti i bot. Puoi scegliere di consentire tutto (lo standard per la maggior parte dei siti web pubblici) o bloccare tutto (utile per ambienti di staging o reti private).

Direttive personalizzate: Aggiungi regole specifiche per singoli bot o percorsi. Puoi bloccare l'accesso di tutti i crawler a directory sensibili come /admin/ o /search, consentendo al contempo a bot specifici di accedere a determinati file.

Blocco dei crawler IA: Con la diffusione dei modelli linguistici di grandi dimensioni, molti proprietari di siti web preferiscono evitare lo scraping dei propri contenuti per l'addestramento dell'IA. Questo strumento include una funzione dedicata per bloccare i crawler IA nel file robots.txt. Spuntando una singola casella, vengono aggiunte all'istante le direttive Disallow: / per i bot IA più comuni, tra cui GPTBot, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended e Bytespider.

Ritardo di scansione: Se il tuo server fatica a gestire il traffico intenso dei bot automatizzati, puoi impostare un ritardo di scansione. Questo genera una direttiva Crawl-delay, che indica ai bot di attendere un numero specificato di secondi tra una richiesta e l'altra.

Integrazione della Sitemap: Una direttiva sitemap nel file robots.txt è il modo più efficiente per indicare ai motori di ricerca dove trovare le tue sitemap XML. Puoi incollare più URL di sitemap (uno per riga) e lo strumento li formatterà correttamente, aggiungendoli in fondo al file.

Come creare file robots.txt in modo efficace

Quando crei file robots.txt, è importante capire come i crawler leggono le istruzioni. Il file è diviso in blocchi, ciascuno dei quali inizia con una dichiarazione User-agent seguita dalle relative regole.

  1. Identifica lo User-agent: Lo user-agent è il nome del bot. L'uso di un asterisco (*) applica la regola a tutti i bot. Per rivolgerti specificamente al crawler di immagini di Google, usa Googlebot-Image.
  2. Definisci il percorso: I percorsi sono relativi alla root del dominio e devono iniziare con uno slash (/). Per bloccare un'intera directory, includi lo slash finale (es. /private/). Per bloccare un file specifico, includi l'estensione (es. /data.csv).
  3. Ordine di priorità: La maggior parte dei crawler moderni cerca il blocco user-agent più specifico corrispondente al proprio nome. Se Googlebot visita il tuo sito, seguirà le regole specifiche sotto User-agent: Googlebot e ignorerà il blocco User-agent: *. Questo generatore organizza automaticamente le tue regole per user-agent per garantire un output pulito e valido.

Comprendere i limiti

Sebbene un generatore di file robots.txt semplifichi la scrittura della sintassi, è fondamentale capire cosa questo file non può fare.

Non è una misura di sicurezza. Bloccare un percorso nel file robots.txt indica ai bot rispettosi di non scansionarlo, ma gli scraper malevoli ignoreranno completamente il file. Inoltre, chiunque può leggere il tuo file robots.txt aprendolo nel browser, il che significa rendere pubblica la posizione delle tue directory nascoste. Per una vera sicurezza, utilizza un'autenticazione adeguata e i Codici di stato HTTP appropriati, come 401 Unauthorized o 403 Forbidden.

Non garantisce la deindicizzazione. Se una pagina è bloccata nel file robots.txt, Google non la scansionerà. Tuttavia, se la pagina riceve link da altre parti del web, Google potrebbe comunque indicizzarne l'URL (mostrando spesso il messaggio "Nessuna informazione disponibile per questa pagina"). Se l'obiettivo è rimuovere completamente una pagina dai risultati dei motori di ricerca, dovresti consentirne la scansione nel robots.txt e utilizzare invece un tag HTML noindex. Puoi generare i tag corretti utilizzando il nostro Generatore di Meta Tag.

Pubblicazione e test

Una volta configurate le regole, fai clic su download per salvare il file. Il file deve chiamarsi esattamente robots.txt (tutto in minuscolo) ed essere caricato nella directory principale del tuo dominio. Ad esempio, https://yourdomain.com/robots.txt. Se lo inserisci in una sottocartella, come https://yourdomain.com/assets/robots.txt, i crawler non lo troveranno e presumeranno che non ci sia alcuna restrizione.

Domande frequenti

Cos'è un file robots.txt?
Un file robots.txt è un semplice file di testo posizionato nella directory principale di un sito web. Fornisce istruzioni ai web robot (come Googlebot) su quali pagine o file possono o non possono richiedere dal tuo sito.
Come bloccare i crawler IA?
Selezionando l'opzione "Blocca IA" in questo strumento, vengono aggiunte automaticamente le regole per bloccare i noti scraper di dati IA, tra cui GPTBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended e altri. Questo indica ai bot di non utilizzare i contenuti del tuo sito web per l'addestramento di modelli linguistici di grandi dimensioni.
A cosa serve il crawl delay?
La direttiva crawl delay indica ai bot quanti secondi devono attendere tra richieste successive al tuo server. È utile se crawler aggressivi consumano troppa larghezza di banda o rallentano il tuo sito web. Nota che non tutti i motori di ricerca (come Google) rispettano questa direttiva, ma molti altri sì.
Dove devo posizionare il file robots.txt?
Deve essere posizionato nella directory principale (root) del tuo sito web. Ad esempio, se il tuo dominio è example.com, il file deve essere accessibile esattamente su https://example.com/robots.txt. Se viene inserito in una sottodirectory, i crawler non lo troveranno.
I dati del mio sito web vengono inviati a un server quando uso questo strumento?
No. Questo generatore di file robots.txt funziona interamente in locale nel tuo browser. Le tue regole, i percorsi e gli URL della sitemap non vengono mai caricati o memorizzati sui nostri server.
Il robots.txt nasconde le mie pagine dai risultati di ricerca?
Non necessariamente. Sebbene impedisca ai motori di ricerca di scansionare il contenuto della pagina, l'URL potrebbe comunque apparire nei risultati di ricerca se altri siti lo linkano. Per rimuovere completamente una pagina dagli indici di ricerca, dovresti usare invece un meta tag "noindex".