SEO e webmaster
Test robots.txt
Scopri all’istante se una pagina è bloccata o consentita per Google.
Contenuto del robots.txt
Il file robots.txt dice ai motori di ricerca cosa possono esplorare sul tuo sito. Basta una riga scritta male per bloccare un’intera cartella — o tutto il sito — mentre per i visitatori umani tutto sembra perfettamente normale. Questo strumento scarica il robots.txt di qualsiasi sito, ne mostra il contenuto completo e poi simula un crawler: inserisci un percorso e uno user-agent (per esempio Googlebot) e ottieni il verdetto — consentito o bloccato. La simulazione applica le vere regole di priorità, inclusi la corrispondenza più lunga, il jolly * e l’ancora $, quindi la risposta coincide con ciò che farebbe davvero Google. Gratuito, senza registrazione, ideale prima e dopo ogni messa online.
Come funziona?
- Inserisci l’indirizzo del sito: il suo file robots.txt viene scaricato e mostrato.
- Digita il percorso da testare (esempio: /blog/articolo o /admin/).
- Scegli il crawler da simulare (Googlebot, Bingbot o un altro).
- Clicca su « Testa » e leggi il verdetto: consentito o bloccato, con la regola applicata.
Domande frequenti
Bloccare una pagina nel robots.txt la fa sparire da Google?
Non necessariamente. Il blocco impedisce la scansione, non l’indicizzazione: se altri siti linkano la pagina, Google può comunque mostrarla senza descrizione. Per tenere una pagina fuori dai risultati usa il tag noindex — e lascia che i crawler accedano alla pagina per poterlo leggere.
Cosa significa « Disallow: / »?
È il blocco totale: i crawler interessati non possono esplorare il sito. Spesso è un residuo dimenticato della fase di sviluppo — ed è uno degli errori SEO più costosi, perché il sito scompare a poco a poco dai risultati di ricerca.
Come funzionano il jolly * e il simbolo $?
L’asterisco sostituisce qualsiasi sequenza di caratteri: « Disallow: /*.pdf » blocca tutti i PDF. Il dollaro àncora la fine dell’URL: « Disallow: /*.pdf$ » blocca solo gli indirizzi che terminano esattamente con .pdf. In caso di conflitto vince la corrispondenza più lunga, e a parità di lunghezza Allow prevale su Disallow.
Il mio sito non ha un robots.txt: è un problema?
No: senza il file, i motori esplorano tutto, il che va bene per la maggior parte dei siti piccoli. Il file diventa utile per tenere i crawler lontani dalle aree senza valore (ricerca interna, filtri, carrello) e per indicare l’indirizzo della sitemap.