Alle artikelen

Cloudflare blokkeert AI-crawlers standaard: wat dat betekent voor je site

Cloudflare zette AI-crawlers in juli 2025 op deny-by-default en stelt op 15 september 2026 nieuwe standaarden in voor advertentiepagina's. Wat er veranderde, wat het je kost aan AI-citaties, en hoe je de crawlers toelaat en verifieert die je echt wilt.

12 aug 20268 min leestijd

Als je domein na 1 juli 2025 bij Cloudflare is gekomen, zijn AI-crawlers zeer waarschijnlijk geblokkeerd en heeft niemand je daarover bericht. Cloudflare zette nieuwe domeinen die dag op deny-by-default, voegde in september 2025 een robots.txt-vocabulaire toe voor contentgebruik, en blokkeert vanaf 15 september 2026 training- en agentverkeer standaard op pagina's met advertenties. De juiste reactie is niet alles weer aanzetten. Het is de crawlers kiezen die je wilt, bij naam, en daarna controleren of de requests die die namen dragen echt zijn.

Wat Cloudflare werkelijk veranderde, en wanneer

1 juli 2025. Cloudflare riep Content Independence Day uit en werd de eerste grote infrastructuuraanbieder die AI-crawlers standaard blokkeert. Het persbericht van die dag beschreef de omslag nuchter: nieuwe domeinen in het netwerk weigeren toegang van AI-crawlers tenzij de eigenaar die uitdrukkelijk inschakelt. Van opt-out naar opt-in. Cloudflare schat zijn eigen aandeel in het webverkeer op ongeveer 20 procent, dus één standaardwijziging verzette in één keer een groot deel van het web. Meer dan een miljoen bestaande klanten had de blokkade met één klik sinds september 2024 al aangezet. Tegelijk verscheen Pay Per Crawl in beta, waarmee eigenaren een crawler een HTTP 402 Payment Required kunnen teruggeven in plaats van content.

Het argument van Cloudflare was een verhouding. Gemeten aan het verkeer van juni 2025 lag de verhouding tussen crawls en referrals op 1.700:1 voor OpenAI en 73.000:1 voor Anthropic, tegenover 14:1 bij Google Search. Enorm veel ophalen, heel weinig verkeer terug.

28 augustus 2025. De AI Audit-beta werd AI Crawl Control en ging algemeen beschikbaar: een overzicht per crawler van wie wat ophaalde, allow- en block-schakelaars per operator, en eigen 402-antwoorden op betaalde abonnementen.

24 september 2025. Cloudflare publiceerde de Content Signals Policy onder CC0, met een generator op ContentSignals.org. Die voegt een regel toe aan robots.txt die beschrijft hoe content gebruikt mag worden nadat die is opgehaald, iets wat robots.txt nooit dekte. Drie signalen, elk op yes, no of leeg:

User-Agent: *
Content-Signal: search=yes, ai-train=no
Allow: /

Cloudflare schreef dat beleid voor ruim 3,8 miljoen domeinen in de beheerde robots.txt. Waar training al geblokkeerd was, luidde de gepubliceerde standaard search=yes, ai-train=no, met ai-input bewust opengelaten in plaats van geweigerd.

1 juli 2026. Cloudflare splitste botgedrag in drie classificaties en stelde ze beschikbaar aan elke klant, ook op het gratis niveau: Search (content verzamelen en indexeren om later vragen te beantwoorden), Agent (in realtime handelen namens een persoon) en Training (content overnemen om een model te trainen of fine-tunen). Er kwam ook een datum bij. Op 15 september 2026 blijft Search standaard toegestaan, terwijl Training en Agent standaard worden geblokkeerd op pagina's met advertenties. Die standaarden gelden voor nieuwe klanten, voor nieuwe sites van bestaande klanten en voor gratis accounts die de instelling voor de deadline niet hebben gewijzigd. Een crawler die meerdere doelen mengt zonder ze te scheiden, valt onder de strengste regel die op een van zijn gedragingen van toepassing is. Content Signals kreeg een vierde parameter, use=, met de waarden immediate, reference en full. En Pay Per Crawl werd Pay Per Use, dat betaalt wanneer content daadwerkelijk in een antwoord opduikt in plaats van wanneer een bot een pagina ophaalt, met Ceramic.ai en You.com als eerste partners.

InstellingWaar die zitWat die werkelijk doet
Beheerde robots.txtCloudflare-dashboard, gratisPubliceert een verzoek. Nette crawlers volgen het op, andere negeren het
Content Signals (search, ai-input, ai-train, use)Regel in robots.txtBenoemt toegestaan gebruik na het ophalen. Nog steeds een verzoek, geen blokkade
Block AI Bots-schakelaarSecurity-instellingenHandhaving aan de edge. Breed en bot
AI Crawl ControlEigen dashboardAllow, block of 402 per crawler, gehandhaafd voordat je origin de request ziet
Standaarden voor Search / Agent / TrainingGeldt vanaf 15 september 2026Handhaving op categorieniveau, eerst op advertentiepagina's
Pay Per UseOpt-in-programmaBetaling wanneer je content in een antwoord verschijnt

De kosten die nooit in je analytics opduiken

Een geblokkeerde crawler levert geen foutpagina op waar je ooit naar kijkt. Geen bounce, geen 500, geen supportticket. De assistent antwoordt gewoon vanaf de pagina van iemand anders, en je merkt het maanden later als een concurrent geciteerd wordt.

Dat weegt elk kwartaal zwaarder. Cloudflares eigen bericht over answer engine optimisation van 6 augustus 2026 stelde vast dat minder dan de helft van alle HTML-paginaverzoeken nog van een mens komt. Als retrieval-bots je documentatie, je prijspagina of je vergelijkingscontent niet bereiken, ontbreek je in de bronnenpoel waar antwoordmachines uit putten. Een trainingcrawler blokkeren en een retrieval-crawler blokkeren voelen in een dashboard als dezelfde schakelaar. Het is niet dezelfde beslissing, en slechts een ervan beschermt iets waar je om geeft.

Het onderscheid dat je je eigen moet maken: trainingcrawlers nemen je content één keer mee en geven per request niets terug. Retrieval- en agentverkeer is een lezer die nu met een vraag aankomt. GPTBot traint. OAI-SearchBot indexeert voor antwoorden. ChatGPT-User haalt een pagina op omdat dertig seconden geleden iemand ernaar vroeg. Hetzelfde bedrijf, drie tokens, drie heel verschillende ruilen.

robots.txt is een verzoek. De edge is een beslissing.

Dit is de grens die de meeste sitebeheerders laten vervagen. Disallow: / in robots.txt is een bordje op de deur. Nette operators lezen het en keren om. De rest leest het als een lijst interessante paden, of leest het helemaal niet. Content Signals hoort in dezelfde categorie: een heldere, machineleesbare verklaring van intentie, waarvan de waarde eerder juridisch en sociaal is dan technisch.

De controles van Cloudflare zitten een laag lager. De request wordt aan de edge geweigerd voordat je origin hem ziet, ongeacht wat de client van robots.txt vond. Dat is echt nuttig, en precies daarom weegt de standaard zo zwaar. Een voorkeur die je nooit hebt uitgesproken, wordt nu namens jou gehandhaafd.

De praktische consequentie: je robots.txt en je edge-regels moeten hetzelfde zeggen. Een site die Allow: / publiceert voor PerplexityBot terwijl Cloudflare hem aan de edge blokkeert, geeft een tegenstrijdig signaal af aan een operator die naleving meet.

Controleer bij welk netwerk een crawler-IP echt hoort

Laat de crawlers toe die je wilt, op exacte token

Match niet op de substring "bot". Match niet op "GPT". Sta specifieke tokens toe, want de tokens dragen het doel:

CrawlerDoelHoe die te verifiëren isOnder de advertentiestandaarden van 15 september
GPTBotModeltraining voor OpenAIGepubliceerd IP-rangebestandTraininggedrag, geblokkeerd op advertentiepagina's
OAI-SearchBotIndexeren voor zoekresultaten in ChatGPTGepubliceerd IP-rangebestandSearchgedrag, blijft toegestaan
ChatGPT-UserLive ophalen door een gebruikerspromptGepubliceerd IP-rangebestandAgentgedrag, geblokkeerd op advertentiepagina's
PerplexityBotIndexeren voor antwoorden van PerplexityGepubliceerd IP-rangebestandSearchgedrag, blijft toegestaan
Perplexity-UserLive ophalen namens een persoonGepubliceerd IP-rangebestandAgentgedrag, geblokkeerd op advertentiepagina's
ClaudeBotModeltraining voor AnthropicGepubliceerd IP-rangebestandTraininggedrag, geblokkeerd op advertentiepagina's
Google-ExtendedAlleen opt-out-token voor training, crawlt nooitrobots.txt-token, geen eigen verkeerRegelt trainingsgebruik, niet de toegang
CCBotDataverzameling voor Common CrawlGeen gepubliceerde ranges of DNS-conventieTraininggedrag, geblokkeerd op advertentiepagina's
BytespiderVerzameling door ByteDanceGeen gepubliceerde verificatiemethodeTraininggedrag, geblokkeerd op advertentiepagina's

De eigen classificatie per bot van Cloudflare is wat de handhaving gebruikt, dus controleer AI Crawl Control voordat je een toewijzing aanneemt. Onze AI-crawlergids bevat de exacte User-Agent-tokens, operators, gepubliceerde IP-rangebestanden en het robots.txt-gedrag van 150 agents, en dat is precies wat je nodig hebt om regels te schrijven die niet per ongeluk de verkeerde bot raken.

Google-Extended is het duidelijkste voorbeeld waarom tokens ertoe doen. Het stuurt nooit een request. Het bestaat alleen zodat je bezwaar kunt maken tegen trainingsgebruik terwijl Googlebot je normaal blijft indexeren. Het aan de edge blokkeren levert niets op, want er is daar niets om te blokkeren.

Controleer daarna wat er werkelijk binnenkomt

GPTBot toestaan op User-Agent betekent alles toestaan dat GPTBot in een header typt. Scrapers weten dat al jaren, en een allowlist gebouwd op strings is een uitnodiging. Achter elke allow-regel hoort een verificatiestap.

De meeste grote AI-operators publiceren inmiddels JSON-bestanden met IP-ranges, en de oudere zoekcrawlers ondersteunen forward-confirmed reverse DNS. De methode verschilt per operator, wat precies het vervelende deel is: Googlebot en Bingbot resolven, GPTBot en PerplexityBot publiceren ranges, Bytespider en CCBot publiceren niets controleerbaars. Zie Googlebot verifiëren voor het reverse-DNS-patroon in detail.

Waar een geclaimde crawler niet te verifiëren is, gelden de gewone vervangende signalen: is het adres een datacenter-range die niet toebehoort aan de operator die wordt geclaimd, past de TLS-fingerprint bij de geclaimde client, zijn de headers consistent. Agentscan doet dit per request, bevestigt geverifieerde crawlers forward-confirmed, matcht gepubliceerde ranges en combineert IP-herkomst met JA4 en headless-kenmerken om mens, bekende bot, AI-agent of kwaadaardige automatisering terug te geven. Verdicts worden gecachet, dus herhaalde controles komen binnen 50ms terug.

Kort samengevat

Cloudflare heeft de standaard twee keer verschoven, en de tweede verschuiving landt op 15 september 2026. Controleer waar je zone nu op staat in plaats van aan te nemen wat je denkt. Beslis apart over training, retrieval en agentverkeer, want die drie tot één schakelaar samenpersen is precies wat je ongemerkt uit AI-antwoorden haalt. Publiceer je intentie in robots.txt met Content Signals, handhaaf het bijbehorende beleid aan de edge, sta de crawlers die je wilt toe op exacte token, en verifieer elk van hen tegen gepubliceerde ranges of reverse DNS in plaats van een header die iedereen kan typen.

FAQ

Veelgestelde vragen

Ja, voor nieuwe domeinen. Cloudflare kondigde op 1 juli 2025 aan dat nieuw aangemelde domeinen toegang van AI-crawlers weigeren tenzij de eigenaar het aanzet, waarmee het grootste CDN van het web van opt-out naar opt-in ging. Een tweede wijziging landt op 15 september 2026: training- en agentverkeer wordt standaard geblokkeerd op pagina's met advertenties, voor nieuwe klanten en voor gratis accounts die de instelling niet hebben aangepast.

Gerelateerde artikelen