Alle tools

Gratis tool

Robots.txt tester

Plak je robots.txt, kies een crawler en een URL. Je ziet niet alleen of de URL geblokkeerd is, maar ook welke regel gewonnen heeft en waarom.

Toegestaan

Van de 2 matchende regels heeft regel 3 het langste patroon (/wp-admin/admin-ajax.php, 24 tekens) en wint daarmee.

Toegepaste groep: User-agent *

Matchende regels, langste patroon eerst

  • r3: Allow: /wp-admin/admin-ajax.php ← wint
  • r2: Disallow: /wp-admin/

Gevonden sitemaps: https://voorbeeld.nl/sitemap.xml

Hoe robots.txt beslist

Bijna iedereen leest robots.txt van boven naar beneden en gaat ervan uit dat de eerste of de laatste matchende regel wint. Dat is niet hoe het werkt. Een crawler kiest eerst de groep die bij zijn eigen naam hoort. Staat er een groep voor Googlebot, dan negeert Googlebot de groep voor sterretje volledig, ook de regels die daar wel in staan en in zijn eigen groep niet.

Binnen die groep wint vervolgens het langste pad-patroon. Daarom werkt de standaard WordPress-combinatie: Disallow op /wp-admin/ is elf tekens, Allow op /wp-admin/admin-ajax.php is dertig tekens, dus admin-ajax blijft bereikbaar. Zijn twee patronen precies even lang, dan wint Allow. Matcht er niets, dan is de URL toegestaan.

In een pad betekent een sterretje nul of meer willekeurige tekens en een dollarteken het einde van de URL. Disallow op /*.pdf$ blokkeert dus /handleiding.pdf maar niet /handleiding.pdf?download=1, omdat de querystring achter het einde valt.

De fout die we in WordPress het vaakst zien

Een Disallow op /wp-content/ of op /wp-includes/. Daarmee blokkeer je ook de CSS- en JavaScript-bestanden van je thema en je plugins. Google rendert je pagina dan zonder opmaak, kan de layout niet beoordelen en ziet mogelijk content niet die pas na het laden van JavaScript verschijnt. Blokkeer je uploads-map ook niet, want dan verdwijnen je afbeeldingen uit Google Afbeeldingen.

Het tweede misverstand: robots.txt gebruiken om iets uit de index te houden. Dat werkt niet. Crawlen en indexeren zijn twee verschillende dingen. Blokkeer je een pagina, dan kan Google de noindex-tag op die pagina niet eens lezen, en blijft hij mogelijk juist in de resultaten staan. Wil je een pagina eruit, laat hem dan crawlbaar en zet er een noindex op.

Veelgestelde vragen

Welke regel wint als er meerdere matchen?

De regel met het langste pad-patroon wint, ongeacht de volgorde in het bestand. Zijn twee patronen even lang, dan wint Allow van Disallow. Deze tool laat bij elke test zien welke regel gewonnen heeft en waarom.

Betekent Disallow dat een pagina uit Google verdwijnt?

Nee. Disallow verbiedt crawlen, niet indexeren. Een geblokkeerde URL kan nog steeds in de resultaten verschijnen als er links naar wijzen, dan zonder omschrijving. Wil je een pagina echt uit de index, gebruik dan een noindex meta robots-tag en blokkeer de pagina juist niet in robots.txt, want anders kan Google die tag niet lezen.

Werkt noindex in robots.txt nog?

Nee. Google ondersteunt de noindex-regel in robots.txt sinds september 2019 niet meer. Deze tool waarschuwt je als hij die regel in je bestand tegenkomt.

Moet ik /wp-admin/ blokkeren in WordPress?

WordPress zet die regel standaard in de virtuele robots.txt, samen met een Allow voor admin-ajax.php. Laat dat staan. Blokkeer wel niet /wp-content/uploads/ of je CSS- en JS-bestanden: als Google die niet kan ophalen, kan hij je pagina niet renderen zoals een bezoeker hem ziet.

Kijkt deze tool naar mijn echte robots.txt?

Nee, hij rekent op de tekst die je zelf plakt. Zo kun je een wijziging testen voordat je hem live zet. Je eigen bestand staat op jouwdomein.nl/robots.txt.

Verder lezen

Andere tools