Zeventien grote Nederlandse websites, één simpele test, en bij vier ervan gaat de deur niet open. De crawler van ChatGPT krijgt bij Wehkamp een pagina met de tekst “toegang geblokkeerd”, bij Coolblue een leeg blauw scherm, en bij Albert Heijn en Jumbo wordt de verbinding zonder uitleg dichtgegooid. Een gewone bezoeker komt op alle vier moeiteloos binnen. Dat mag allemaal: het is een keuze die je als bedrijf zelf maakt. Alleen: bij negentien van de twintig onderzochte sites staat er geen enkele regel over AI-bots in het robots.txt-bestand. En op 15 september zet Cloudflare de standaardinstelling om.
AI-bedrijven sturen verschillende bots langs je site: eentje die pagina's ophaalt om er later naar te kunnen verwijzen, eentje die traint, en eentje die live iets opzoekt voor een gebruiker. Met één commando in je terminal zie je of ze bij jou binnenkomen. Blokkeer je de verkeerde, dan verdwijn je uit de antwoorden van ChatGPT.
Wat gebeurde er bij de test op zeventien Nederlandse sites?
Bij vier van de zeventien geteste sites kreeg een AI-crawler geen pagina te zien, terwijl dezelfde pagina met een gewone browsernaam wel gewoon werd geladen. Er zit een filter tussen dat naar de naam van de bezoeker kijkt: dezelfde pagina, een andere naam, een ander antwoord.
De opzet was zo simpel mogelijk. Op 28 augustus 2026 is van elke site de homepage opgevraagd onder vier verschillende namen: een normale Chrome-bezoeker, GPTBot van OpenAI, OAI-SearchBot van OpenAI en ClaudeBot van Anthropic. Verder was alles gelijk: dezelfde machine, dezelfde verbinding, hetzelfde moment. De meting is twee keer gedaan en gaf beide keren hetzelfde beeld.
| Site | Gewone bezoeker | GPTBot (training) | OAI-SearchBot (ChatGPT-zoek) | ClaudeBot (training) |
|---|---|---|---|---|
| coolblue.nl | 200 | 403 | 403 | 403 |
| wehkamp.nl | 200 | 403 | 200 | 403 |
| ah.nl | 200 | verbinding verbroken | verbinding verbroken | verbinding verbroken |
| jumbo.com | 200 | verbinding verbroken | verbinding verbroken | verbinding verbroken |
| mediamarkt.nl | 200 | 200 | 200 | 200 |
| marktplaats.nl, hema.nl, ns.nl, kvk.nl, belastingdienst.nl, anwb.nl, vandebron.nl, dille-kamille.nl, greetz.nl | 200 | 200 | 200 | 200 |
| bol.com, thuisbezorgd.nl, rabobank.nl | 403 | 403 | 403 | 403 |
Die laatste rij verdient uitleg. Bij bol.com, thuisbezorgd.nl en rabobank.nl kwam ook de gewone bezoeker er niet doorheen. Daar staat een algemene botmuur die alles weert wat niet als echte browser oogt, en dat zegt dus niets specifieks over AI. Een tweede nuance: echte crawlers komen ook van vaste, gepubliceerde IP-reeksen, en die zaten niet in deze test. Een site die alleen op naam filtert, filtert deze test net zo hard als de echte crawler. Wat je in de tabel ziet, is dus dat naamfilter.

Even voor de beeldvorming: bij Coolblue is het antwoord op een AI-bot één effen blauw scherm met de zin “Coolblue, alles voor een glimlach”. Meer staat er niet. Geen productpagina's, geen prijzen, geen reviews, niets waar een AI-assistent iets mee kan als een klant vraagt welke wasmachine hij moet kopen.

Van de twintig opgehaalde robots.txt-bestanden noemt er precies één de AI-bots bij naam: dat van MediaMarkt. En daar staat bij elke bot hetzelfde: Allow: /. Oftewel, kom binnen. Eén site van de twintig heeft er dus zichtbaar over nagedacht.
Welke bots kloppen er eigenlijk aan?
OpenAI en Anthropic sturen elk drie tot vier verschillende bots langs, en die doen niet hetzelfde werk. Ze hebben eigen namen, en je kunt ze los van elkaar toelaten of weigeren.
| Bot | Van wie | Waarvoor | Wat blokkeren betekent |
|---|---|---|---|
| OAI-SearchBot | OpenAI | Indexeert je site voor de zoekfunctie van ChatGPT | Je verschijnt niet meer in ChatGPT-zoekantwoorden |
| GPTBot | OpenAI | Haalt content op om modellen te trainen | Je teksten gaan niet in nieuwe trainingsdata |
| ChatGPT-User | OpenAI | Haalt een pagina op omdat een gebruiker er nu om vraagt | ChatGPT kan je pagina niet live openen voor die gebruiker |
| OAI-AdsBot | OpenAI | Controleert pagina's die als advertentie worden aangeboden | Advertenties naar die pagina kunnen worden geweigerd |
| Claude-SearchBot | Anthropic | Verbetert de zoekresultaten in Claude | Je bent minder zichtbaar in Claude-antwoorden |
| ClaudeBot | Anthropic | Verzamelt webcontent voor training | Je teksten gaan niet in nieuwe trainingsdata |
| Claude-User | Anthropic | Haalt een pagina op namens een gebruiker die het vraagt | Claude kan je pagina niet ophalen voor die gebruiker |
In de documentatie van OpenAI staat het er duidelijk: sites die OAI-SearchBot buitensluiten worden niet getoond in de zoekantwoorden van ChatGPT. GPTBot weigeren doet dat niet. Dat gaat alleen over trainen. Anthropic beschrijft hetzelfde onderscheid voor ClaudeBot en Claude-SearchBot.
Denk aan een winkel met twee deuren: eentje voor klanten die iets komen halen, eentje voor de fotograaf die beelden ophaalt voor andermans folder. Je mag die fotograaf best weigeren. Dan moet je alleen wel weten welke deur welke is.
Wehkamp laat OAI-SearchBot binnen en houdt GPTBot en ClaudeBot buiten. Dat is het verschil tussen “train niet op mijn teksten” en “vind mij wel”, en het is de enige site in de test die dat onderscheid maakt.
Waarom 15 september een datum is om te noteren
Cloudflare verandert op 15 september 2026 de standaardinstelling voor nieuwe domeinen die bij het bedrijf worden aangemeld. Bots met het gedrag Training of Agent worden dan standaard geblokkeerd op pagina's die advertenties tonen. Bots die onder Search vallen blijven wel toegestaan. Dat kondigde Cloudflare aan op 1 juli 2026.
Het bedrijf deelt AI-verkeer in drie soorten gedrag in, en die indeling bepaalt straks wat er dichtgaat:
“Search is elk gedrag dat je content verzamelt of indexeert, zodat er later vragen over beantwoord kunnen worden.”
Cloudflare, aankondiging van 1 juli 2026, vertaald uit het Engels
- Search: verzamelt en indexeert je content om er later vragen over te beantwoorden. Daar hoort verwijzend verkeer tegenover te staan.
- Agent: handelt in real time namens een persoon, bijvoorbeeld een assistent die nu een pagina voor jou opent.
- Training: haalt je content op om er een model mee te trainen of bij te schaven.
Per categorie kun je zelf kiezen: blokkeren op alle pagina's, alleen blokkeren op pagina's met advertenties, of helemaal niet blokkeren. Crawlers die zoeken en trainen combineren, vallen ook onder de blokkade voor training. Wil je iets anders dan de nieuwe standaard, dan kun je dat volgens Cloudflare tot 15 september in je eigen instellingen aangeven.
Overigens verandert er aan je bestaande instellingen niets vanzelf. Maar die knop staat er al, ook bij jou, en de kans is groot dat niemand in je bedrijf ooit heeft gekeken wat erop staat. Dat geldt net zo goed voor de securityplug-in van je website of het bot-filter van je hostingpartij.
Hoe test je je eigen site in vijf minuten?
Je hebt hiervoor alleen een terminal en je eigen webadres nodig. De hele test doe je van buitenaf, dus je hoeft niets aan je site aan te passen en je hebt geen toegang tot de server nodig.
Stap 1. Lees je eigen robots.txt. Dit bestand staat in de hoofdmap van je site en is voor iedereen zichtbaar.
curl -s https://jouwsite.nl/robots.txt | grep -iE 'gptbot|oai-searchbot|claudebot|claude-searchbot|perplexitybot|google-extended'
Komt er niets terug, dan staat er geen enkele regel over AI-bots in. Dat betekent niet automatisch dat ze binnenkomen. Robots.txt is een verzoek, geen slot.
Stap 2. Klop aan als bot. Vervang het adres bovenin door dat van jezelf en plak dit blok in je terminal.
SITE="https://jouwsite.nl/" MENS="Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/140.0 Safari/537.36" GPTBOT="Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.2; +https://openai.com/gptbot" ZOEKBOT="Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot" CLAUDEBOT="Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ClaudeBot/1.0; [email protected]" for naam in MENS GPTBOT ZOEKBOT CLAUDEBOT; do eval ua=\$$naam code=$(curl -s -o /dev/null -w "%{http_code}" -A "$ua" -L --max-time 12 "$SITE") echo "$naam: $code" done
Krijg je overal 200 terug, dan gaat de deur voor iedereen open. Zie je 403, 401 of 000 bij de bots terwijl MENS wel 200 geeft, dan blokkeert er iets onderweg: je hosting, je firewall, je CDN of een securityplug-in. Een 000 betekent dat de verbinding werd verbroken voordat er een antwoord kwam, zoals bij ah.nl en jumbo.com.
Stap 3. Kijk of er überhaupt bots langskomen. Heb je toegang tot je logbestanden, dan tel je in één regel hoe vaak elke bot in je huidige logbestand heeft aangeklopt.
for bot in GPTBot OAI-SearchBot ChatGPT-User ClaudeBot Claude-SearchBot PerplexityBot; do echo -n "$bot: " grep -ic "$bot" /var/log/nginx/access.log done
Nul over de hele linie is een signaal, geen bewijs: misschien komen ze niet, misschien worden ze eerder al tegengehouden door je CDN en halen ze je server nooit. Werk je met WordPress bij een hostingpartij, dan vind je dezelfde cijfers meestal in het statistiekenscherm van je hosting of in het dashboard van Cloudflare.
Stap 4. Vraag het de assistent zelf. Open ChatGPT of Claude, stel de vraag die een klant zou stellen over jouw product of dienst, en kijk of jouw site tussen de bronnen staat. Dat is geen meting, maar wel de snelste realiteitscheck die je hebt.
Wat zet je in je robots.txt?
De meest gekozen variant onder bedrijven is “vind mij wel, train niet op mij”. Dit blok legt dat vast en kun je letterlijk overnemen.
# Zoeken en opzoeken: welkom User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / # Trainen: bewust niet User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: /
Wil je juist alles toelaten, zoals MediaMarkt doet, dan zet je overal Allow: /. Wil je alles buiten de deur, dan overal Disallow: /. Drie dingen om op te letten:
- Het bestand heet exact
robots.txten staat in de hoofdmap van elk domein en elk subdomein apart. Je webshop en je blog op een ander subdomein hebben dus elk hun eigen bestand. - Een blok
User-agent: *metDisallow: /, bijvoorbeeld overgebleven van een testomgeving, geldt ook voor AI-bots. Die algemene regel is precies wat Reddit op dit moment gebruikt om alles buiten te houden. - Robots.txt is een verzoek. Wil je een blokkade afdwingen, dan regel je dat bij je server, je firewall of je CDN. Cloudflare heeft daar een aparte instelling voor.
Twijfel je of een bezoeker die zich GPTBot noemt echt van OpenAI komt? Beide bedrijven publiceren de IP-reeksen van hun crawlers, OpenAI per bot en Anthropic in één lijst. Een bot met de juiste naam maar een IP-adres dat er niet in staat, is niet wie hij zegt te zijn.
Wanneer je AI-bots juist wel buiten wilt houden
Er zijn goede redenen om de deur dicht te doen, en de belangrijkste is dat er weinig tegenover staat. Cloudflare rekende in juli 2025 voor dat het via OpenAI ongeveer 750 keer lastiger is geworden om er bezoekers uit te halen dan in het oude Google-tijdperk, en via Anthropic 30.000 keer. Je content wordt gelezen, je site wordt niet bezocht.
Blokkeren is verstandig als je verdienmodel op bezoekers of abonnees draait, als je content achter een betaalmuur of ledenomgeving hoort te blijven, of als je merkt dat crawlers je server platleggen. Ook productdata die je liever niet één op één bij een prijsvergelijker ziet opduiken, is een reden.
Zit je aan de andere kant en bouw je agents die zelf websites uitlezen, dan loop je tegen dezelfde muur aan, alleen van buiten: steeds meer deuren gaan dicht. Wie dagelijks met dat soort AI-agents werkt, bijvoorbeeld met Claude Code-sessies die elkaar aansturen, merkt dat een groeiend deel van het web simpelweg niet meer opengaat.
Wat je in elk geval niet wilt, is het per ongeluk doen. Een webshop die uit de antwoorden van ChatGPT verdwijnt omdat een securityplug-in ooit “blokkeer AI-bots” aan heeft gezet, heeft geen keuze gemaakt maar een instelling geërfd.
Wat je vóór 15 september geregeld wilt hebben
Drie dingen, en je bent er in een half uur doorheen. Eén: draai de test uit stap 2 op je eigen site en noteer per bot wat eruit komt. Twee: kijk in je CDN of firewall welke AI-instelling er nu aanstaat, want dat is de plek waar het echt wordt afgedwongen. Drie: leg vast wat je wilt, in je robots.txt en in je CDN, zodat de volgende collega die aan de securityknoppen zit weet wat de bedoeling was.
Vind je dat je content niets te zoeken heeft in een taalmodel, dan is dichtdoen een prima besluit. Vind je dat een klant die aan ChatGPT vraagt welke leverancier hij moet bellen jouw naam hoort te zien, dan is dit de maand om te controleren of die deur wel echt openstaat. Meer artikelen over vindbaarheid en agents staan op het blog.
Veelgestelde vragen
Verdwijn ik uit ChatGPT als ik GPTBot blokkeer?
Nee. GPTBot haalt content op om modellen te trainen. Je zichtbaarheid in de zoekantwoorden van ChatGPT loopt via OAI-SearchBot. Blokkeer je die, dan word je volgens de documentatie van OpenAI niet meer getoond in ChatGPT-zoekresultaten.
Is robots.txt genoeg om AI-bots buiten te houden?
Nee. Robots.txt is een verzoek waar nette partijen zich aan houden, geen technische blokkade. Wil je het afdwingen, dan doe je dat op je server, in je firewall of bij je CDN, bijvoorbeeld via de botinstellingen van Cloudflare.
Hoe controleer ik of een bot echt van OpenAI of Anthropic is?
Beide bedrijven publiceren de IP-reeksen van hun crawlers, OpenAI per bot in aparte JSON-bestanden en Anthropic in één lijst. Een bezoeker die zich GPTBot noemt maar van een IP-adres buiten die lijst komt, is niet OpenAI.
Wat verandert Cloudflare op 15 september 2026?
Nieuwe domeinen die vanaf dat moment bij Cloudflare worden aangemeld krijgen een nieuwe standaard: bots met het gedrag Training of Agent worden geblokkeerd op pagina's met advertenties, terwijl Search toegestaan blijft. Per categorie kun je zelf kiezen tussen blokkeren op alle pagina's, alleen op pagina's met advertenties, of niet blokkeren.
Ik gebruik WordPress en kan niet bij mijn logbestanden. Wat kan ik dan?
De toegangstest uit stap 2 doe je volledig van buitenaf, daar heb je alleen je webadres voor nodig. Je robots.txt pas je aan via je SEO-plug-in of via een bestand in de hoofdmap. Wie je site blokkeert zie je terug in het dashboard van je hosting of je CDN.