AI-bots op je website: blokkeren of juist binnenlaten?

5 min leestijd
AI-bots op je website: blokkeren of juist binnenlaten?

Wie weleens in de bezoekersstatistieken of serverlogs van zijn website kijkt, ziet ze steeds vaker langskomen: GPTBot, ClaudeBot, PerplexityBot, Google-Extended. AI-bedrijven sturen massaal robots over het web, en jouw site staat op hun route. De reflex van veel site-eigenaren is: blokkeren die handel. Maar dat is lang niet altijd slim.

Want er zijn grofweg twee soorten AI-bots, en het verschil bepaalt alles.

Trainingsbots en zoekbots zijn niet hetzelfde

Trainingsbots verzamelen tekst om er toekomstige AI-modellen mee te trainen. Jouw content wordt dan onderdeel van het “geheugen” van zo’n model. Bekende voorbeelden: GPTBot (OpenAI), ClaudeBot (Anthropic) en Google-Extended (het aparte signaal waarmee Google toestemming vraagt voor AI-training).

Zoekbots doen iets anders: ze halen je pagina op om er hier en nu een antwoord mee te geven aan een gebruiker, vaak mét bronvermelding en link. OAI-SearchBot (de zoekfunctie van ChatGPT) en PerplexityBot zijn zoekbots. Ook ChatGPT-User hoort in dit rijtje: die haalt een pagina live op wanneer een gebruiker er expliciet om vraagt.

Het verwarrende: GPTBot en OAI-SearchBot komen van hetzelfde bedrijf, maar doen iets fundamenteel anders. Blokkeer je ze allebei “omdat het AI is”, dan gooi je het kind met het badwater weg.

En let op: Google AI Overviews (de AI-samenvattingen bovenaan Google) gebruikt de gewone Google-index. Die kun je niet blokkeren zonder ook uit de normale zoekresultaten te verdwijnen.

Wat gebeurt er als je blokkeert?

Blokkeer je de zoekbots, dan word je onzichtbaar in AI-antwoorden. Vraagt een potentiële klant aan ChatGPT of Perplexity om een aanbeveling in jouw branche, dan kan jouw site simpelweg niet als bron worden gebruikt. Voor de meeste ondernemers is dat een verlies, geen winst — zeker nu steeds meer mensen op die manier zoeken.

Blokkeer je de trainingsbots, dan houd je je content buiten toekomstige modellen. Dat is een principiële keuze die weinig invloed heeft op je directe vindbaarheid. Voor wie zijn teksten, foto’s of onderzoek als kernproduct heeft, is dat een verdedigbare lijn.

Kant-en-klare robots.txt-regels

Je regelt dit in het bestand robots.txt in de hoofdmap van je site. Drie veelgebruikte varianten:

Variant 1: alles toelaten. Niets doen — wie geen regels opneemt, laat alle bots toe. Prima keuze voor de meeste dienstverleners.

Variant 2: training blokkeren, AI-zoekmachines toelaten.

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Zoekbots (OAI-SearchBot, PerplexityBot) noem je niet,
# dus die blijven gewoon welkom.

Variant 3: alle AI-bots weren. Voeg aan de lijst hierboven ook OAI-SearchBot en PerplexityBot toe. Weet dan wat je doet: je verdwijnt uit AI-antwoorden.

Eerlijke kanttekening: robots.txt is een verzoek, geen slot op de deur. Nette bots van grote partijen houden zich eraan; louche scrapers trekken zich er niets van aan. Voor die laatste groep heb je serverregels of een firewall nodig.

En llms.txt dan?

Misschien ben je de term llms.txt tegengekomen: een voorgesteld bestand waarin je in platte tekst samenvat waar je site over gaat, speciaal voor AI-systemen. Is dat de moeite? Ons nuchtere antwoord: het kost weinig, maar verwacht er geen wonderen van. Er is geen garantie dat de grote AI-partijen het bestand ook echt gebruiken. Zie het als een net visitekaartje dat je voor de zekerheid neerlegt — niet als vervanging van een goed gestructureerde site.

Advies per situatie

  • Dienstverlener of lokaal bedrijf (kapper, installateur, adviesbureau): laat alles toe. Elke vermelding in een AI-antwoord is gratis reclame.
  • Content als product (fotograaf, uitgever, onderzoeksbureau): blokkeer de trainingsbots, laat de zoekbots toe. Zo blijf je vindbaar zonder gratis lesmateriaal te zijn.
  • Webshop met botoverlast: hier speelt iets anders — agressieve crawlers kunnen je shop traag maken of zelfs platleggen doordat ze je cache omzeilen. Lees dan eerst Webshop traag of 503-fout? Grote kans dat het een bot is.

Twijfel je? Laat dan alles open en kijk over een paar maanden opnieuw. Blokkeren kan altijd nog; gemiste vermeldingen krijg je niet terug.

Samengevat

  • Trainingsbots (GPTBot, ClaudeBot, Google-Extended) verzamelen data voor toekomstige AI-modellen; zoekbots (OAI-SearchBot, PerplexityBot) gebruiken je pagina voor antwoorden mét bronvermelding.
  • Zoekbots blokkeren = onzichtbaar worden in AI-antwoorden. Voor de meeste mkb-sites onverstandig.
  • Trainingsbots blokkeren is een principiële keuze die je vindbaarheid nauwelijks raakt.
  • Regel het met een paar regels in robots.txt; llms.txt mag, maar verwacht er weinig van.
  • Wil je juist gevónden worden in AI-antwoorden? Lees dan ons artikel over AEO — de basis blijft gewoon goede SEO.

Wanneer schakel je hulp in?

Kun je je robots.txt niet vinden of bewerken, of wil je zeker weten dat een blokkade goed staat zonder per ongeluk Google buiten te sluiten? Vraag het je webbouwer of hoster — dit is een klus van een kwartier voor wie er dagelijks mee werkt. Twijfel je wat er nu allemaal op je site rondkruipt, dan is een blik in de access-logs de snelste reality check.

Geen code nodig

Klaar om te beginnen met OnePage?

Bouw je eigen professionele website zonder code

Probeer 14 dagen gratis
Geen creditcard nodig
Alle features inbegrepen
Nederlandse templates