SEO e webmaster

Test robots.txt

Scopri all’istante se una pagina è bloccata o consentita per Google.

    Contenuto del robots.txt

     

    Il file robots.txt dice ai motori di ricerca cosa possono esplorare sul tuo sito. Basta una riga scritta male per bloccare un’intera cartella — o tutto il sito — mentre per i visitatori umani tutto sembra perfettamente normale. Questo strumento scarica il robots.txt di qualsiasi sito, ne mostra il contenuto completo e poi simula un crawler: inserisci un percorso e uno user-agent (per esempio Googlebot) e ottieni il verdetto — consentito o bloccato. La simulazione applica le vere regole di priorità, inclusi la corrispondenza più lunga, il jolly * e l’ancora $, quindi la risposta coincide con ciò che farebbe davvero Google. Gratuito, senza registrazione, ideale prima e dopo ogni messa online.

    Come funziona?

    1. Inserisci l’indirizzo del sito: il suo file robots.txt viene scaricato e mostrato.
    2. Digita il percorso da testare (esempio: /blog/articolo o /admin/).
    3. Scegli il crawler da simulare (Googlebot, Bingbot o un altro).
    4. Clicca su « Testa » e leggi il verdetto: consentito o bloccato, con la regola applicata.

    Domande frequenti

    Bloccare una pagina nel robots.txt la fa sparire da Google?

    Non necessariamente. Il blocco impedisce la scansione, non l’indicizzazione: se altri siti linkano la pagina, Google può comunque mostrarla senza descrizione. Per tenere una pagina fuori dai risultati usa il tag noindex — e lascia che i crawler accedano alla pagina per poterlo leggere.

    Cosa significa « Disallow: / »?

    È il blocco totale: i crawler interessati non possono esplorare il sito. Spesso è un residuo dimenticato della fase di sviluppo — ed è uno degli errori SEO più costosi, perché il sito scompare a poco a poco dai risultati di ricerca.

    Come funzionano il jolly * e il simbolo $?

    L’asterisco sostituisce qualsiasi sequenza di caratteri: « Disallow: /*.pdf » blocca tutti i PDF. Il dollaro àncora la fine dell’URL: « Disallow: /*.pdf$ » blocca solo gli indirizzi che terminano esattamente con .pdf. In caso di conflitto vince la corrispondenza più lunga, e a parità di lunghezza Allow prevale su Disallow.

    Il mio sito non ha un robots.txt: è un problema?

    No: senza il file, i motori esplorano tutto, il che va bene per la maggior parte dei siti piccoli. Il file diventa utile per tenere i crawler lontani dalle aree senza valore (ricerca interna, filtri, carrello) e per indicare l’indirizzo della sitemap.

    Strumenti correlati