Bij Coolblue en Wehkamp komt ChatGPT niet binnen: zo test je je eigen site
Online zichtbaarheid

Bij Coolblue en Wehkamp komt ChatGPT niet binnen: zo test je je eigen site

· 11 min leestijd

Zeventien grote Nederlandse websites, één simpele test, en bij vier ervan gaat de deur niet open. De crawler van ChatGPT krijgt bij Wehkamp een pagina met de tekst “toegang geblokkeerd”, bij Coolblue een leeg blauw scherm, en bij Albert Heijn en Jumbo wordt de verbinding zonder uitleg dichtgegooid. Een gewone bezoeker komt op alle vier moeiteloos binnen. Dat mag allemaal: het is een keuze die je als bedrijf zelf maakt. Alleen: bij negentien van de twintig onderzochte sites staat er geen enkele regel over AI-bots in het robots.txt-bestand. En op 15 september zet Cloudflare de standaardinstelling om.

Kort antwoord

AI-bedrijven sturen verschillende bots langs je site: eentje die pagina's ophaalt om er later naar te kunnen verwijzen, eentje die traint, en eentje die live iets opzoekt voor een gebruiker. Met één commando in je terminal zie je of ze bij jou binnenkomen. Blokkeer je de verkeerde, dan verdwijn je uit de antwoorden van ChatGPT.

Wat gebeurde er bij de test op zeventien Nederlandse sites?

Bij vier van de zeventien geteste sites kreeg een AI-crawler geen pagina te zien, terwijl dezelfde pagina met een gewone browsernaam wel gewoon werd geladen. Er zit een filter tussen dat naar de naam van de bezoeker kijkt: dezelfde pagina, een andere naam, een ander antwoord.

De opzet was zo simpel mogelijk. Op 28 augustus 2026 is van elke site de homepage opgevraagd onder vier verschillende namen: een normale Chrome-bezoeker, GPTBot van OpenAI, OAI-SearchBot van OpenAI en ClaudeBot van Anthropic. Verder was alles gelijk: dezelfde machine, dezelfde verbinding, hetzelfde moment. De meting is twee keer gedaan en gaf beide keren hetzelfde beeld.

SiteGewone bezoekerGPTBot (training)OAI-SearchBot (ChatGPT-zoek)ClaudeBot (training)
coolblue.nl200403403403
wehkamp.nl200403200403
ah.nl200verbinding verbrokenverbinding verbrokenverbinding verbroken
jumbo.com200verbinding verbrokenverbinding verbrokenverbinding verbroken
mediamarkt.nl200200200200
marktplaats.nl, hema.nl, ns.nl, kvk.nl, belastingdienst.nl, anwb.nl, vandebron.nl, dille-kamille.nl, greetz.nl200200200200
bol.com, thuisbezorgd.nl, rabobank.nl403403403403

Die laatste rij verdient uitleg. Bij bol.com, thuisbezorgd.nl en rabobank.nl kwam ook de gewone bezoeker er niet doorheen. Daar staat een algemene botmuur die alles weert wat niet als echte browser oogt, en dat zegt dus niets specifieks over AI. Een tweede nuance: echte crawlers komen ook van vaste, gepubliceerde IP-reeksen, en die zaten niet in deze test. Een site die alleen op naam filtert, filtert deze test net zo hard als de echte crawler. Wat je in de tabel ziet, is dus dat naamfilter.

De homepage van wehkamp.nl toont de melding toegang geblokkeerd wanneer de pagina wordt opgevraagd als GPTBot
Dit ziet GPTBot van OpenAI op wehkamp.nl: geen webshop, maar de melding “toegang geblokkeerd”. Eigen schermafbeelding, 28 augustus 2026.

Even voor de beeldvorming: bij Coolblue is het antwoord op een AI-bot één effen blauw scherm met de zin “Coolblue, alles voor een glimlach”. Meer staat er niet. Geen productpagina's, geen prijzen, geen reviews, niets waar een AI-assistent iets mee kan als een klant vraagt welke wasmachine hij moet kopen.

De homepage van coolblue.nl toont een blauw scherm met de tekst Coolblue alles voor een glimlach wanneer de pagina wordt opgevraagd als ClaudeBot
Hetzelfde adres, opgevraagd als ClaudeBot van Anthropic: coolblue.nl antwoordt met een blauwe blokkadepagina. Eigen schermafbeelding, 28 augustus 2026.

Van de twintig opgehaalde robots.txt-bestanden noemt er precies één de AI-bots bij naam: dat van MediaMarkt. En daar staat bij elke bot hetzelfde: Allow: /. Oftewel, kom binnen. Eén site van de twintig heeft er dus zichtbaar over nagedacht.

Welke bots kloppen er eigenlijk aan?

OpenAI en Anthropic sturen elk drie tot vier verschillende bots langs, en die doen niet hetzelfde werk. Ze hebben eigen namen, en je kunt ze los van elkaar toelaten of weigeren.

BotVan wieWaarvoorWat blokkeren betekent
OAI-SearchBotOpenAIIndexeert je site voor de zoekfunctie van ChatGPTJe verschijnt niet meer in ChatGPT-zoekantwoorden
GPTBotOpenAIHaalt content op om modellen te trainenJe teksten gaan niet in nieuwe trainingsdata
ChatGPT-UserOpenAIHaalt een pagina op omdat een gebruiker er nu om vraagtChatGPT kan je pagina niet live openen voor die gebruiker
OAI-AdsBotOpenAIControleert pagina's die als advertentie worden aangebodenAdvertenties naar die pagina kunnen worden geweigerd
Claude-SearchBotAnthropicVerbetert de zoekresultaten in ClaudeJe bent minder zichtbaar in Claude-antwoorden
ClaudeBotAnthropicVerzamelt webcontent voor trainingJe teksten gaan niet in nieuwe trainingsdata
Claude-UserAnthropicHaalt een pagina op namens een gebruiker die het vraagtClaude kan je pagina niet ophalen voor die gebruiker

In de documentatie van OpenAI staat het er duidelijk: sites die OAI-SearchBot buitensluiten worden niet getoond in de zoekantwoorden van ChatGPT. GPTBot weigeren doet dat niet. Dat gaat alleen over trainen. Anthropic beschrijft hetzelfde onderscheid voor ClaudeBot en Claude-SearchBot.

Denk aan een winkel met twee deuren: eentje voor klanten die iets komen halen, eentje voor de fotograaf die beelden ophaalt voor andermans folder. Je mag die fotograaf best weigeren. Dan moet je alleen wel weten welke deur welke is.

Wehkamp laat OAI-SearchBot binnen en houdt GPTBot en ClaudeBot buiten. Dat is het verschil tussen “train niet op mijn teksten” en “vind mij wel”, en het is de enige site in de test die dat onderscheid maakt.

Waarom 15 september een datum is om te noteren

Cloudflare verandert op 15 september 2026 de standaardinstelling voor nieuwe domeinen die bij het bedrijf worden aangemeld. Bots met het gedrag Training of Agent worden dan standaard geblokkeerd op pagina's die advertenties tonen. Bots die onder Search vallen blijven wel toegestaan. Dat kondigde Cloudflare aan op 1 juli 2026.

Het bedrijf deelt AI-verkeer in drie soorten gedrag in, en die indeling bepaalt straks wat er dichtgaat:

“Search is elk gedrag dat je content verzamelt of indexeert, zodat er later vragen over beantwoord kunnen worden.”

Cloudflare, aankondiging van 1 juli 2026, vertaald uit het Engels
  • Search: verzamelt en indexeert je content om er later vragen over te beantwoorden. Daar hoort verwijzend verkeer tegenover te staan.
  • Agent: handelt in real time namens een persoon, bijvoorbeeld een assistent die nu een pagina voor jou opent.
  • Training: haalt je content op om er een model mee te trainen of bij te schaven.

Per categorie kun je zelf kiezen: blokkeren op alle pagina's, alleen blokkeren op pagina's met advertenties, of helemaal niet blokkeren. Crawlers die zoeken en trainen combineren, vallen ook onder de blokkade voor training. Wil je iets anders dan de nieuwe standaard, dan kun je dat volgens Cloudflare tot 15 september in je eigen instellingen aangeven.

Overigens verandert er aan je bestaande instellingen niets vanzelf. Maar die knop staat er al, ook bij jou, en de kans is groot dat niemand in je bedrijf ooit heeft gekeken wat erop staat. Dat geldt net zo goed voor de securityplug-in van je website of het bot-filter van je hostingpartij.

Hoe test je je eigen site in vijf minuten?

Je hebt hiervoor alleen een terminal en je eigen webadres nodig. De hele test doe je van buitenaf, dus je hoeft niets aan je site aan te passen en je hebt geen toegang tot de server nodig.

Stap 1. Lees je eigen robots.txt. Dit bestand staat in de hoofdmap van je site en is voor iedereen zichtbaar.

curl -s https://jouwsite.nl/robots.txt | grep -iE 'gptbot|oai-searchbot|claudebot|claude-searchbot|perplexitybot|google-extended'

Komt er niets terug, dan staat er geen enkele regel over AI-bots in. Dat betekent niet automatisch dat ze binnenkomen. Robots.txt is een verzoek, geen slot.

Stap 2. Klop aan als bot. Vervang het adres bovenin door dat van jezelf en plak dit blok in je terminal.

SITE="https://jouwsite.nl/"

MENS="Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/140.0 Safari/537.36"
GPTBOT="Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.2; +https://openai.com/gptbot"
ZOEKBOT="Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot"
CLAUDEBOT="Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ClaudeBot/1.0; [email protected]"

for naam in MENS GPTBOT ZOEKBOT CLAUDEBOT; do
  eval ua=\$$naam
  code=$(curl -s -o /dev/null -w "%{http_code}" -A "$ua" -L --max-time 12 "$SITE")
  echo "$naam: $code"
done

Krijg je overal 200 terug, dan gaat de deur voor iedereen open. Zie je 403, 401 of 000 bij de bots terwijl MENS wel 200 geeft, dan blokkeert er iets onderweg: je hosting, je firewall, je CDN of een securityplug-in. Een 000 betekent dat de verbinding werd verbroken voordat er een antwoord kwam, zoals bij ah.nl en jumbo.com.

Stap 3. Kijk of er überhaupt bots langskomen. Heb je toegang tot je logbestanden, dan tel je in één regel hoe vaak elke bot in je huidige logbestand heeft aangeklopt.

for bot in GPTBot OAI-SearchBot ChatGPT-User ClaudeBot Claude-SearchBot PerplexityBot; do
  echo -n "$bot: "
  grep -ic "$bot" /var/log/nginx/access.log
done

Nul over de hele linie is een signaal, geen bewijs: misschien komen ze niet, misschien worden ze eerder al tegengehouden door je CDN en halen ze je server nooit. Werk je met WordPress bij een hostingpartij, dan vind je dezelfde cijfers meestal in het statistiekenscherm van je hosting of in het dashboard van Cloudflare.

Stap 4. Vraag het de assistent zelf. Open ChatGPT of Claude, stel de vraag die een klant zou stellen over jouw product of dienst, en kijk of jouw site tussen de bronnen staat. Dat is geen meting, maar wel de snelste realiteitscheck die je hebt.

Wat zet je in je robots.txt?

De meest gekozen variant onder bedrijven is “vind mij wel, train niet op mij”. Dit blok legt dat vast en kun je letterlijk overnemen.

# Zoeken en opzoeken: welkom
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

# Trainen: bewust niet
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

Wil je juist alles toelaten, zoals MediaMarkt doet, dan zet je overal Allow: /. Wil je alles buiten de deur, dan overal Disallow: /. Drie dingen om op te letten:

  1. Het bestand heet exact robots.txt en staat in de hoofdmap van elk domein en elk subdomein apart. Je webshop en je blog op een ander subdomein hebben dus elk hun eigen bestand.
  2. Een blok User-agent: * met Disallow: /, bijvoorbeeld overgebleven van een testomgeving, geldt ook voor AI-bots. Die algemene regel is precies wat Reddit op dit moment gebruikt om alles buiten te houden.
  3. Robots.txt is een verzoek. Wil je een blokkade afdwingen, dan regel je dat bij je server, je firewall of je CDN. Cloudflare heeft daar een aparte instelling voor.

Twijfel je of een bezoeker die zich GPTBot noemt echt van OpenAI komt? Beide bedrijven publiceren de IP-reeksen van hun crawlers, OpenAI per bot en Anthropic in één lijst. Een bot met de juiste naam maar een IP-adres dat er niet in staat, is niet wie hij zegt te zijn.

Wanneer je AI-bots juist wel buiten wilt houden

Er zijn goede redenen om de deur dicht te doen, en de belangrijkste is dat er weinig tegenover staat. Cloudflare rekende in juli 2025 voor dat het via OpenAI ongeveer 750 keer lastiger is geworden om er bezoekers uit te halen dan in het oude Google-tijdperk, en via Anthropic 30.000 keer. Je content wordt gelezen, je site wordt niet bezocht.

Blokkeren is verstandig als je verdienmodel op bezoekers of abonnees draait, als je content achter een betaalmuur of ledenomgeving hoort te blijven, of als je merkt dat crawlers je server platleggen. Ook productdata die je liever niet één op één bij een prijsvergelijker ziet opduiken, is een reden.

Zit je aan de andere kant en bouw je agents die zelf websites uitlezen, dan loop je tegen dezelfde muur aan, alleen van buiten: steeds meer deuren gaan dicht. Wie dagelijks met dat soort AI-agents werkt, bijvoorbeeld met Claude Code-sessies die elkaar aansturen, merkt dat een groeiend deel van het web simpelweg niet meer opengaat.

Wat je in elk geval niet wilt, is het per ongeluk doen. Een webshop die uit de antwoorden van ChatGPT verdwijnt omdat een securityplug-in ooit “blokkeer AI-bots” aan heeft gezet, heeft geen keuze gemaakt maar een instelling geërfd.

Wat je vóór 15 september geregeld wilt hebben

Drie dingen, en je bent er in een half uur doorheen. Eén: draai de test uit stap 2 op je eigen site en noteer per bot wat eruit komt. Twee: kijk in je CDN of firewall welke AI-instelling er nu aanstaat, want dat is de plek waar het echt wordt afgedwongen. Drie: leg vast wat je wilt, in je robots.txt en in je CDN, zodat de volgende collega die aan de securityknoppen zit weet wat de bedoeling was.

Vind je dat je content niets te zoeken heeft in een taalmodel, dan is dichtdoen een prima besluit. Vind je dat een klant die aan ChatGPT vraagt welke leverancier hij moet bellen jouw naam hoort te zien, dan is dit de maand om te controleren of die deur wel echt openstaat. Meer artikelen over vindbaarheid en agents staan op het blog.

Veelgestelde vragen

Verdwijn ik uit ChatGPT als ik GPTBot blokkeer?

Nee. GPTBot haalt content op om modellen te trainen. Je zichtbaarheid in de zoekantwoorden van ChatGPT loopt via OAI-SearchBot. Blokkeer je die, dan word je volgens de documentatie van OpenAI niet meer getoond in ChatGPT-zoekresultaten.

Is robots.txt genoeg om AI-bots buiten te houden?

Nee. Robots.txt is een verzoek waar nette partijen zich aan houden, geen technische blokkade. Wil je het afdwingen, dan doe je dat op je server, in je firewall of bij je CDN, bijvoorbeeld via de botinstellingen van Cloudflare.

Hoe controleer ik of een bot echt van OpenAI of Anthropic is?

Beide bedrijven publiceren de IP-reeksen van hun crawlers, OpenAI per bot in aparte JSON-bestanden en Anthropic in één lijst. Een bezoeker die zich GPTBot noemt maar van een IP-adres buiten die lijst komt, is niet OpenAI.

Wat verandert Cloudflare op 15 september 2026?

Nieuwe domeinen die vanaf dat moment bij Cloudflare worden aangemeld krijgen een nieuwe standaard: bots met het gedrag Training of Agent worden geblokkeerd op pagina's met advertenties, terwijl Search toegestaan blijft. Per categorie kun je zelf kiezen tussen blokkeren op alle pagina's, alleen op pagina's met advertenties, of niet blokkeren.

Ik gebruik WordPress en kan niet bij mijn logbestanden. Wat kan ik dan?

De toegangstest uit stap 2 doe je volledig van buitenaf, daar heb je alleen je webadres voor nodig. Je robots.txt pas je aan via je SEO-plug-in of via een bestand in de hoofdmap. Wie je site blokkeert zie je terug in het dashboard van je hosting of je CDN.

Michael Groeneweg
Geschreven door Michael Groeneweg AI-specialist bij Digital Impact · Oprichter van TheAIDaily en Pantheon

Michael is AI-specialist bij Digital Impact in Rotterdam en oprichter van TheAIDaily.nl en Pantheon, waar hij AI-agents en oplossingen bouwt voor bedrijven. Al tien jaar ondernemer, en sinds een paar jaar weigert hij iets te doen waar geen AI in verweven zit, zakelijk noch privé, tot mild ongenoegen van zijn omgeving. Zijn reizen door de wereld zijn inmiddels een serie experimenten in wat AI wel en niet kan vanaf een terrasje in Lissabon of een treinstation in Tokio. Hij test obsessief nieuwe tools, bouwt oplossingen voor klanten, en vindt dat niemand de hype moet geloven, maar ook niemand meer kan doen alsof AI niet alles verandert. Houdt van goede koffie, lange vluchten en mensen die met AI bouwen in plaats van er alleen over praten.