Web crawler uitgelegd: hoe Google jouw site leest
Een web crawler is een programma dat automatisch websites bezoekt, links volgt en pagina's opslaat. Google gebruikt zijn crawler Googlebot om het hele web in kaart te brengen. Alles wat je in de zoekresultaten ziet, is ooit door zo'n crawler opgehaald. Begrijp je hoe dat werkt, dan begrijp je ook waarom sommige pagina's onvindbaar blijven.
Wat doet een web crawler precies?
Een crawler begint met een lijst bekende URL's en werkt die af. Op elke pagina leest hij de content en verzamelt hij alle links. Die nieuwe links gaan weer op de lijst. Zo kruipt het programma van pagina naar pagina door het web, vandaar ook de bijnaam spider.
Wat de crawler ophaalt, gaat naar de volgende schakel: de index. Dat is de gigantische bibliotheek waar Google zoekresultaten uit put. Crawlen is dus niet hetzelfde als geïndexeerd worden. Eerst ophalen, dan beoordelen, dan pas opnemen. Op elk van die stappen kan het misgaan.
Googlebot is niet de enige bezoeker van dit soort. Bing heeft Bingbot, en AI-bedrijven sturen inmiddels hun eigen crawlers op pad, zoals GPTBot van OpenAI. Voor wie ook in AI-antwoorden gevonden wil worden, zijn die nieuwe crawlers net zo relevant als de klassieke.
Hoe leest Googlebot jouw pagina's?
Googlebot haalt eerst de kale HTML van je pagina op. Voor veel websites staat daar alle content al in en is het werk klaar. Moderne sites bouwen hun pagina's echter vaak op met JavaScript, en dan volgt een tweede stap: het renderen. Google zet de pagina dan in een wachtrij om hem volledig uit te voeren, zoals een browser dat doet.
Die renderstap kost tijd en kan later plaatsvinden dan de eerste crawl. Content die alleen via JavaScript zichtbaar wordt, loopt daardoor risico op vertraging of wordt in het slechtste geval gemist. De vuistregel is simpel: hoe belangrijker de content, hoe directer hij in de HTML hoort te staan.
Verder crawlt Google tegenwoordig mobile-first. De smartphone-versie van Googlebot is leidend: wat op je mobiele site ontbreekt, bestaat voor Google eigenlijk niet. Een desktopsite met een uitgeklede mobiele variant snijdt zichzelf dus in de vingers.
Ook statuscodes sturen het gedrag van de crawler. Een pagina die netjes een 200 teruggeeft, wordt gelezen en verwerkt. Een 301-redirect stuurt de crawler door naar het nieuwe adres. Een 404 vertelt dat de pagina weg is, en na herhaalde 404's geeft Googlebot het op. Serverfouten in de 500-reeks zijn het schadelijkst: die remmen het hele crawlproces af, omdat Google je server wil ontzien. Houd je foutrapportages in Search Console daarom schoon.
Hoe stuur je een crawler door je site?
Je hebt drie stuurmiddelen. Het eerste is je robots.txt-bestand, de portier van je website. Daarin staat welke delen van je site crawlers mogen bezoeken en welke niet. Handig voor winkelwagens, interne zoekresultaten, filterpagina's en testomgevingen die niets in Google te zoeken hebben.
Het tweede is je XML-sitemap, de plattegrond. Daarmee vertel je crawlers welke pagina's er zijn en wanneer ze voor het laatst gewijzigd zijn. Vooral nieuwe en diepgelegen pagina's profiteren daarvan, omdat de crawler ze anders alleen via links kan ontdekken.
Het derde en meest onderschatte stuurmiddel: je interne links. Een crawler volgt nu eenmaal links. Pagina's waar veel interne links naartoe wijzen, worden vaak bezocht. Een pagina zonder enkele inkomende link is voor een crawler onzichtbaar, hoe goed de content ook is. Zulke weespagina's komen we bij vrijwel elke sitecontrole tegen.
Wat betekenen AI-crawlers voor jouw website?
Naast de klassieke zoekmachines crawlt inmiddels een nieuwe generatie bots het web. OpenAI stuurt GPTBot op pad, Anthropic heeft ClaudeBot en Perplexity gebruikt PerplexityBot. Zij verzamelen content waarmee AI-modellen hun antwoorden bouwen. Wie in die antwoorden genoemd wil worden, moet ook voor deze crawlers bereikbaar zijn.
Dat vraagt om een bewuste keuze in je robots.txt. Sommige site-eigenaren blokkeren AI-bots uit principe. Begrijpelijk, maar besef wat je daarmee weggeeft: een blokkade betekent dat jouw kennis niet meegenomen wordt wanneer ChatGPT of Perplexity een vraag uit jouw vakgebied beantwoordt. Je concurrent die wél toegang geeft, wordt dan de bron. Voor de meeste MKB-bedrijven weegt die zichtbaarheid zwaarder dan het bezwaar.
Waarom is crawlbaarheid de basis van je vindbaarheid?
Alles wat je aan SEO doet, veronderstelt dat Google je pagina's kan ophalen. De beste content ter wereld rankt niet als de crawler hem nooit bereikt. Daarom begint technische SEO altijd bij de vraag: kan Googlebot overal komen waar hij moet zijn, en blijft hij weg waar hij niets te zoeken heeft?
Hoe vaak de crawler daadwerkelijk langskomt en hoe je dat ritme opschroeft, lees je in ons artikel over de crawlsnelheid van Google. En wil je zeker weten dat er geen technische blokkades in je site zitten, dan is een technische SEO-audit de logische eerste stap.
Een web crawler is de eerste lezer van elke pagina die je publiceert. Zorg dat die lezer binnenkomt, alles vindt en niets verkeerd begrijpt. Twijfel je of jouw site goed crawlbaar is? Bekijk onze SEO-dienstenpagina of plan een gratis gesprek via empowers.nl/contact.
Veelgestelde vragen over web crawlers
Wat is een web crawler?
Een web crawler is een programma dat automatisch websites bezoekt, links volgt en pagina's ophaalt. Zoekmachines gebruiken crawlers om het web in kaart te brengen. De bekendste is Googlebot, de crawler van Google die bepaalt welke pagina's in de index terechtkomen.
Is een crawler hetzelfde als een spider of bot?
Ja, de termen crawler, spider en bot worden door elkaar gebruikt voor hetzelfde soort programma. Spider verwijst naar het beeld van een programma dat over het wereldwijde web kruipt. Bot is de bredere term voor elk geautomatiseerd programma.
Hoe weet ik of Googlebot mijn site kan lezen?
Gebruik URL-inspectie in Google Search Console en bekijk de gecrawlde pagina. Daar zie je precies wat Googlebot ophaalt en of er blokkades zijn. Controleer daarnaast je robots.txt-bestand: daarin staat welke delen van je site je voor crawlers hebt afgesloten.
Kan Googlebot JavaScript lezen?
Ja, Googlebot voert JavaScript uit, maar in een aparte renderstap die later kan plaatsvinden dan de eerste crawl. Content die pas na veel scripts zichtbaar wordt, loopt daardoor vertraging op of wordt gemist. Belangrijke content zet je daarom bij voorkeur direct in de HTML.
Crawlt Google mijn site als mobiel of als desktop?
Google werkt met mobile-first indexering: de smartphone-versie van Googlebot is leidend voor vrijwel alle websites. Wat op mobiel niet zichtbaar of niet aanwezig is, telt in de praktijk niet mee. Je mobiele site is dus je echte site.
Hoe houd ik een crawler tegen?
Met een robots.txt-bestand geef je aan welke delen van je site crawlers niet mogen bezoeken. Wil je een pagina wel laten crawlen maar uit de zoekresultaten houden, gebruik dan een noindex-tag. Let op: robots.txt is een verzoek, kwaadwillende bots kunnen het negeren.