Cloudflare blokkeert AI-crawlers standaard: wat dat betekent voor je site
Cloudflare zette AI-crawlers in juli 2025 op deny-by-default en stelt op 15 september 2026 nieuwe standaarden in voor advertentiepagina's. Wat er veranderde, wat het je kost aan AI-citaties, en hoe je de crawlers toelaat en verifieert die je echt wilt.
Als je domein na 1 juli 2025 bij Cloudflare is gekomen, zijn AI-crawlers zeer waarschijnlijk geblokkeerd en heeft niemand je daarover bericht. Cloudflare zette nieuwe domeinen die dag op deny-by-default, voegde in september 2025 een robots.txt-vocabulaire toe voor contentgebruik, en blokkeert vanaf 15 september 2026 training- en agentverkeer standaard op pagina's met advertenties. De juiste reactie is niet alles weer aanzetten. Het is de crawlers kiezen die je wilt, bij naam, en daarna controleren of de requests die die namen dragen echt zijn.
Wat Cloudflare werkelijk veranderde, en wanneer
1 juli 2025. Cloudflare riep Content Independence Day uit en werd de eerste grote infrastructuuraanbieder die AI-crawlers standaard blokkeert. Het persbericht van die dag beschreef de omslag nuchter: nieuwe domeinen in het netwerk weigeren toegang van AI-crawlers tenzij de eigenaar die uitdrukkelijk inschakelt. Van opt-out naar opt-in. Cloudflare schat zijn eigen aandeel in het webverkeer op ongeveer 20 procent, dus één standaardwijziging verzette in één keer een groot deel van het web. Meer dan een miljoen bestaande klanten had de blokkade met één klik sinds september 2024 al aangezet. Tegelijk verscheen Pay Per Crawl in beta, waarmee eigenaren een crawler een HTTP 402 Payment Required kunnen teruggeven in plaats van content.
Het argument van Cloudflare was een verhouding. Gemeten aan het verkeer van juni 2025 lag de verhouding tussen crawls en referrals op 1.700:1 voor OpenAI en 73.000:1 voor Anthropic, tegenover 14:1 bij Google Search. Enorm veel ophalen, heel weinig verkeer terug.
28 augustus 2025. De AI Audit-beta werd AI Crawl Control en ging algemeen beschikbaar: een overzicht per crawler van wie wat ophaalde, allow- en block-schakelaars per operator, en eigen 402-antwoorden op betaalde abonnementen.
24 september 2025. Cloudflare publiceerde de Content Signals Policy onder CC0, met een generator op ContentSignals.org. Die voegt een regel toe aan robots.txt die beschrijft hoe content gebruikt mag worden nadat die is opgehaald, iets wat robots.txt nooit dekte. Drie signalen, elk op yes, no of leeg:
User-Agent: *
Content-Signal: search=yes, ai-train=no
Allow: /
Cloudflare schreef dat beleid voor ruim 3,8 miljoen domeinen in de beheerde robots.txt. Waar training
al geblokkeerd was, luidde de gepubliceerde standaard search=yes, ai-train=no, met ai-input
bewust opengelaten in plaats van geweigerd.
1 juli 2026. Cloudflare splitste botgedrag in drie classificaties en stelde ze beschikbaar aan
elke klant, ook op het gratis niveau: Search (content verzamelen en indexeren om later vragen te
beantwoorden), Agent (in realtime handelen namens een persoon) en Training (content overnemen om een
model te trainen of fine-tunen). Er kwam ook een datum bij. Op 15 september 2026 blijft Search
standaard toegestaan, terwijl Training en Agent standaard worden geblokkeerd op pagina's met
advertenties. Die standaarden gelden voor nieuwe klanten, voor nieuwe sites van bestaande klanten en
voor gratis accounts die de instelling voor de deadline niet hebben gewijzigd. Een crawler die
meerdere doelen mengt zonder ze te scheiden, valt onder de strengste regel die op een van zijn
gedragingen van toepassing is. Content Signals kreeg een vierde parameter, use=, met de waarden
immediate, reference en full. En Pay Per Crawl werd Pay Per Use, dat betaalt wanneer content
daadwerkelijk in een antwoord opduikt in plaats van wanneer een bot een pagina ophaalt, met
Ceramic.ai en You.com als eerste partners.
| Instelling | Waar die zit | Wat die werkelijk doet |
|---|---|---|
| Beheerde robots.txt | Cloudflare-dashboard, gratis | Publiceert een verzoek. Nette crawlers volgen het op, andere negeren het |
Content Signals (search, ai-input, ai-train, use) | Regel in robots.txt | Benoemt toegestaan gebruik na het ophalen. Nog steeds een verzoek, geen blokkade |
| Block AI Bots-schakelaar | Security-instellingen | Handhaving aan de edge. Breed en bot |
| AI Crawl Control | Eigen dashboard | Allow, block of 402 per crawler, gehandhaafd voordat je origin de request ziet |
| Standaarden voor Search / Agent / Training | Geldt vanaf 15 september 2026 | Handhaving op categorieniveau, eerst op advertentiepagina's |
| Pay Per Use | Opt-in-programma | Betaling wanneer je content in een antwoord verschijnt |
De kosten die nooit in je analytics opduiken
Een geblokkeerde crawler levert geen foutpagina op waar je ooit naar kijkt. Geen bounce, geen 500, geen supportticket. De assistent antwoordt gewoon vanaf de pagina van iemand anders, en je merkt het maanden later als een concurrent geciteerd wordt.
Dat weegt elk kwartaal zwaarder. Cloudflares eigen bericht over answer engine optimisation van 6 augustus 2026 stelde vast dat minder dan de helft van alle HTML-paginaverzoeken nog van een mens komt. Als retrieval-bots je documentatie, je prijspagina of je vergelijkingscontent niet bereiken, ontbreek je in de bronnenpoel waar antwoordmachines uit putten. Een trainingcrawler blokkeren en een retrieval-crawler blokkeren voelen in een dashboard als dezelfde schakelaar. Het is niet dezelfde beslissing, en slechts een ervan beschermt iets waar je om geeft.
Het onderscheid dat je je eigen moet maken: trainingcrawlers nemen je content één keer mee en geven per request niets terug. Retrieval- en agentverkeer is een lezer die nu met een vraag aankomt. GPTBot traint. OAI-SearchBot indexeert voor antwoorden. ChatGPT-User haalt een pagina op omdat dertig seconden geleden iemand ernaar vroeg. Hetzelfde bedrijf, drie tokens, drie heel verschillende ruilen.
robots.txt is een verzoek. De edge is een beslissing.
Dit is de grens die de meeste sitebeheerders laten vervagen. Disallow: / in robots.txt is een
bordje op de deur. Nette operators lezen het en keren om. De rest leest het als een lijst interessante
paden, of leest het helemaal niet. Content Signals hoort in dezelfde categorie: een heldere,
machineleesbare verklaring van intentie, waarvan de waarde eerder juridisch en sociaal is dan
technisch.
De controles van Cloudflare zitten een laag lager. De request wordt aan de edge geweigerd voordat je origin hem ziet, ongeacht wat de client van robots.txt vond. Dat is echt nuttig, en precies daarom weegt de standaard zo zwaar. Een voorkeur die je nooit hebt uitgesproken, wordt nu namens jou gehandhaafd.
De praktische consequentie: je robots.txt en je edge-regels moeten hetzelfde zeggen. Een site die
Allow: / publiceert voor PerplexityBot terwijl Cloudflare hem aan de edge blokkeert, geeft een
tegenstrijdig signaal af aan een operator die naleving meet.
Controleer bij welk netwerk een crawler-IP echt hoort
Laat de crawlers toe die je wilt, op exacte token
Match niet op de substring "bot". Match niet op "GPT". Sta specifieke tokens toe, want de tokens dragen het doel:
| Crawler | Doel | Hoe die te verifiëren is | Onder de advertentiestandaarden van 15 september |
|---|---|---|---|
| GPTBot | Modeltraining voor OpenAI | Gepubliceerd IP-rangebestand | Traininggedrag, geblokkeerd op advertentiepagina's |
| OAI-SearchBot | Indexeren voor zoekresultaten in ChatGPT | Gepubliceerd IP-rangebestand | Searchgedrag, blijft toegestaan |
| ChatGPT-User | Live ophalen door een gebruikersprompt | Gepubliceerd IP-rangebestand | Agentgedrag, geblokkeerd op advertentiepagina's |
| PerplexityBot | Indexeren voor antwoorden van Perplexity | Gepubliceerd IP-rangebestand | Searchgedrag, blijft toegestaan |
| Perplexity-User | Live ophalen namens een persoon | Gepubliceerd IP-rangebestand | Agentgedrag, geblokkeerd op advertentiepagina's |
| ClaudeBot | Modeltraining voor Anthropic | Gepubliceerd IP-rangebestand | Traininggedrag, geblokkeerd op advertentiepagina's |
| Google-Extended | Alleen opt-out-token voor training, crawlt nooit | robots.txt-token, geen eigen verkeer | Regelt trainingsgebruik, niet de toegang |
| CCBot | Dataverzameling voor Common Crawl | Geen gepubliceerde ranges of DNS-conventie | Traininggedrag, geblokkeerd op advertentiepagina's |
| Bytespider | Verzameling door ByteDance | Geen gepubliceerde verificatiemethode | Traininggedrag, geblokkeerd op advertentiepagina's |
De eigen classificatie per bot van Cloudflare is wat de handhaving gebruikt, dus controleer AI Crawl Control voordat je een toewijzing aanneemt. Onze AI-crawlergids bevat de exacte User-Agent-tokens, operators, gepubliceerde IP-rangebestanden en het robots.txt-gedrag van 150 agents, en dat is precies wat je nodig hebt om regels te schrijven die niet per ongeluk de verkeerde bot raken.
Google-Extended is het duidelijkste voorbeeld waarom tokens ertoe doen. Het stuurt nooit een request. Het bestaat alleen zodat je bezwaar kunt maken tegen trainingsgebruik terwijl Googlebot je normaal blijft indexeren. Het aan de edge blokkeren levert niets op, want er is daar niets om te blokkeren.
Controleer daarna wat er werkelijk binnenkomt
GPTBot toestaan op User-Agent betekent alles toestaan dat GPTBot in een header typt. Scrapers weten
dat al jaren, en een allowlist gebouwd op strings is een uitnodiging. Achter elke allow-regel hoort
een verificatiestap.
De meeste grote AI-operators publiceren inmiddels JSON-bestanden met IP-ranges, en de oudere zoekcrawlers ondersteunen forward-confirmed reverse DNS. De methode verschilt per operator, wat precies het vervelende deel is: Googlebot en Bingbot resolven, GPTBot en PerplexityBot publiceren ranges, Bytespider en CCBot publiceren niets controleerbaars. Zie Googlebot verifiëren voor het reverse-DNS-patroon in detail.
Waar een geclaimde crawler niet te verifiëren is, gelden de gewone vervangende signalen: is het adres een datacenter-range die niet toebehoort aan de operator die wordt geclaimd, past de TLS-fingerprint bij de geclaimde client, zijn de headers consistent. Agentscan doet dit per request, bevestigt geverifieerde crawlers forward-confirmed, matcht gepubliceerde ranges en combineert IP-herkomst met JA4 en headless-kenmerken om mens, bekende bot, AI-agent of kwaadaardige automatisering terug te geven. Verdicts worden gecachet, dus herhaalde controles komen binnen 50ms terug.
Kort samengevat
Cloudflare heeft de standaard twee keer verschoven, en de tweede verschuiving landt op 15 september 2026. Controleer waar je zone nu op staat in plaats van aan te nemen wat je denkt. Beslis apart over training, retrieval en agentverkeer, want die drie tot één schakelaar samenpersen is precies wat je ongemerkt uit AI-antwoorden haalt. Publiceer je intentie in robots.txt met Content Signals, handhaaf het bijbehorende beleid aan de edge, sta de crawlers die je wilt toe op exacte token, en verifieer elk van hen tegen gepubliceerde ranges of reverse DNS in plaats van een header die iedereen kan typen.
FAQ