Tous les articles

Cloudflare bloque les crawlers IA par défaut : ce que cela change pour votre site

Cloudflare est passé au blocage par défaut des crawlers IA en juillet 2025 et applique de nouveaux réglages par défaut aux pages publicitaires le 15 septembre 2026. Ce qui a changé, ce que cela vous coûte en citations IA, et comment autoriser puis vérifier les crawlers que vous voulez vraiment.

12 août 20269 min de lecture

Si votre domaine a rejoint Cloudflare après le 1er juillet 2025, les crawlers IA sont très probablement bloqués et personne ne vous a prévenu. Cloudflare a basculé les nouveaux domaines en refus par défaut ce jour-là, ajouté en septembre 2025 un vocabulaire robots.txt pour l'usage des contenus, et à partir du 15 septembre 2026 il bloque par défaut le trafic d'entraînement et d'agent sur les pages qui portent de la publicité. La bonne réaction n'est pas de tout rallumer. C'est de choisir nommément les crawlers que vous voulez, puis de vérifier que les requêtes portant ces noms sont authentiques.

Ce que Cloudflare a réellement changé, et quand

1er juillet 2025. Cloudflare a lancé le Content Independence Day et est devenu le premier grand fournisseur d'infrastructure à bloquer les crawlers IA par défaut. Son communiqué de presse du jour décrivait le basculement sans détour : les nouveaux domaines du réseau refusent l'accès aux crawlers IA tant que le propriétaire ne l'autorise pas explicitement. L'opt-out devient l'opt-in. Cloudflare situe sa propre part du trafic web autour de 20 pour cent, donc un seul changement de valeur par défaut a déplacé une large portion du web d'un coup. Plus d'un million de clients existants avaient déjà activé le blocage en un clic depuis septembre 2024. Pay Per Crawl est arrivé en même temps, en bêta, permettant de répondre à un crawler par un HTTP 402 Payment Required au lieu du contenu.

L'argument de Cloudflare tenait dans un rapport. Sur le trafic de juin 2025, il chiffrait le ratio crawls/visites renvoyées à 1 700:1 pour OpenAI et 73 000:1 pour Anthropic, contre 14:1 pour la recherche Google. Énormément de récupération, très peu de trafic en retour.

28 août 2025. La bêta AI Audit est devenue AI Crawl Control et est passée en disponibilité générale : une vue par crawler de qui a récupéré quoi, des interrupteurs allow et block par opérateur, et des réponses 402 personnalisées sur les offres payantes.

24 septembre 2025. Cloudflare a publié la Content Signals Policy sous licence CC0, avec un générateur sur ContentSignals.org. Elle ajoute à robots.txt une ligne décrivant comment un contenu peut être utilisé après récupération, ce que robots.txt n'a jamais couvert. Trois signaux, chacun réglé sur yes, no, ou laissé vide :

User-Agent: *
Content-Signal: search=yes, ai-train=no
Allow: /

Cloudflare a inscrit cette politique dans le robots.txt géré de plus de 3,8 millions de domaines. Là où l'entraînement était déjà bloqué, la valeur par défaut publiée était search=yes, ai-train=no, ai-input étant délibérément laissé vide plutôt que refusé.

1er juillet 2026. Cloudflare a découpé le comportement des bots en trois classifications, mises à disposition de tous les clients y compris l'offre gratuite : Search (collecter et indexer un contenu pour répondre plus tard à des questions), Agent (agir en temps réel pour le compte d'une personne) et Training (prendre un contenu pour entraîner ou affiner un modèle). Une date a suivi. Le 15 septembre 2026, Search reste autorisé par défaut tandis que Training et Agent sont bloqués par défaut sur les pages qui affichent de la publicité. Ces réglages s'appliquent aux nouveaux clients, aux nouveaux sites de clients existants et aux comptes gratuits qui n'auront pas modifié le réglage avant l'échéance. Un crawler qui mélange les usages sans les séparer est traité selon la règle la plus restrictive applicable à l'un de ses comportements. Content Signals a gagné un quatrième paramètre, use=, avec les valeurs immediate, reference et full. Et Pay Per Crawl est devenu Pay Per Use, qui paie lorsque le contenu apparaît réellement dans une réponse plutôt que lorsqu'un bot récupère une page, avec Ceramic.ai et You.com comme premiers partenaires.

ContrôleOù il se trouveCe qu'il fait réellement
robots.txt géréTableau de bord Cloudflare, gratuitPublie une demande. Les crawlers conformes la respectent, les autres l'ignorent
Content Signals (search, ai-input, ai-train, use)Ligne dans robots.txtÉnonce les usages permis après récupération. Toujours une demande, pas un blocage
Interrupteur Block AI BotsRéglages de sécuritéApplication à l'edge. Large, et grossier
AI Crawl ControlTableau de bord dédiéAllow, block ou 402 par crawler, appliqué avant que votre origine ne voie la requête
Réglages Search / Agent / TrainingS'applique à partir du 15 septembre 2026Application par catégorie, pages publicitaires d'abord
Pay Per UseProgramme sur adhésionPaiement lorsque votre contenu apparaît dans une réponse

Le coût qui n'apparaît jamais dans vos statistiques

Un crawler bloqué ne produit aucune page d'erreur que vous irez consulter. Pas de rebond, pas de 500, pas de ticket de support. L'assistant répond simplement à partir de la page de quelqu'un d'autre, et vous le découvrez des mois plus tard quand un concurrent est cité.

Le sujet pèse davantage chaque trimestre. Le billet de Cloudflare du 6 août 2026 sur l'answer engine optimisation relevait que moins de la moitié des requêtes de pages HTML proviennent désormais d'un humain. Si les bots de récupération n'atteignent pas votre documentation, votre page tarifs ou vos contenus comparatifs, vous êtes absent du vivier de sources dans lequel puisent les moteurs de réponse. Bloquer un crawler d'entraînement et bloquer un crawler de récupération donnent l'impression d'être le même interrupteur dans un tableau de bord. Ce n'est pas la même décision, et une seule des deux protège quelque chose qui compte pour vous.

La distinction à intégrer : les crawlers d'entraînement prennent votre contenu une fois et ne rendent rien par requête. Le trafic de récupération et d'agent, c'est un lecteur qui arrive avec une question, maintenant. GPTBot entraîne. OAI-SearchBot indexe pour les réponses. ChatGPT-User récupère une page parce qu'une personne l'a demandée il y a trente secondes. Même entreprise, trois tokens, trois échanges très différents.

robots.txt est une demande. L'edge est une décision.

C'est la ligne que la plupart des propriétaires de sites brouillent. Disallow: / dans robots.txt est un écriteau sur la porte. Les opérateurs sérieux le lisent et font demi-tour. Tous les autres y lisent une liste de chemins intéressants, ou ne le lisent pas du tout. Content Signals appartient à la même catégorie : une déclaration d'intention claire et lisible par machine, dont la valeur est plus juridique et sociale que technique.

Les contrôles de Cloudflare se situent une couche plus bas. La requête est refusée à l'edge avant que votre origine ne la voie, quoi que le client ait cru de robots.txt. C'est réellement utile, et c'est aussi pourquoi la valeur par défaut compte autant. Une préférence que vous n'avez jamais exprimée est désormais appliquée en votre nom.

Conséquence pratique : votre robots.txt et vos règles edge doivent dire la même chose. Un site qui publie Allow: / pour PerplexityBot pendant que Cloudflare le bloque à l'edge envoie un message contradictoire à un opérateur qui mesure la conformité.

Vérifiez à quel réseau appartient réellement une IP de crawler

Autorisez les crawlers voulus, par token exact

Ne faites pas correspondre la sous-chaîne « bot ». Ni « GPT ». Autorisez des tokens précis, car les tokens portent l'usage :

CrawlerUsageComment il se vérifieSous les réglages du 15 septembre pour les pages publicitaires
GPTBotEntraînement de modèle pour OpenAIFichier de plages IP publiéComportement Training, bloqué sur les pages publicitaires
OAI-SearchBotIndexation pour les résultats de recherche ChatGPTFichier de plages IP publiéComportement Search, reste autorisé
ChatGPT-UserRécupération en direct déclenchée par un promptFichier de plages IP publiéComportement Agent, bloqué sur les pages publicitaires
PerplexityBotIndexation pour les réponses de PerplexityFichier de plages IP publiéComportement Search, reste autorisé
Perplexity-UserRécupération en direct pour le compte d'une personneFichier de plages IP publiéComportement Agent, bloqué sur les pages publicitaires
ClaudeBotEntraînement de modèle pour AnthropicFichier de plages IP publiéComportement Training, bloqué sur les pages publicitaires
Google-ExtendedToken d'opt-out d'entraînement uniquement, ne crawle jamaisToken robots.txt, aucun trafic propreContrôle l'usage d'entraînement, pas l'accès
CCBotCollecte de jeux de données Common CrawlAucune plage ni convention DNS publiéeComportement Training, bloqué sur les pages publicitaires
BytespiderCollecte par ByteDanceAucune méthode de vérification publiéeComportement Training, bloqué sur les pages publicitaires

C'est la classification par bot de Cloudflare qui pilote son application, alors vérifiez AI Crawl Control avant de supposer une correspondance. Notre annuaire des crawlers IA recense les tokens User-Agent exacts, les opérateurs, les fichiers de plages IP publiés et le comportement robots.txt de 150 agents, ce qu'il faut pour écrire des règles qui n'attrapent pas le mauvais bot par accident.

Google-Extended est l'exemple le plus net de l'importance des tokens. Il n'envoie jamais de requête. Il existe uniquement pour vous permettre de refuser l'usage d'entraînement pendant que Googlebot continue de vous indexer normalement. Le bloquer à l'edge ne sert à rien, puisqu'il n'y a rien à bloquer.

Puis vérifiez ce qui arrive vraiment

Autoriser GPTBot par User-Agent revient à autoriser tout ce qui tape GPTBot dans un en-tête. Les scrapers l'ont compris depuis des années, et une allowlist bâtie sur des chaînes de caractères est une invitation. Derrière chaque règle allow, il faut une étape de vérification.

La plupart des grands opérateurs IA publient désormais des fichiers JSON de plages IP, et les crawlers de recherche plus anciens prennent en charge le reverse DNS confirmé dans les deux sens. La méthode diffère selon l'opérateur, et c'est précisément la partie pénible : Googlebot et Bingbot se résolvent, GPTBot et PerplexityBot publient des plages, Bytespider et CCBot ne publient rien de vérifiable. Voir vérifier Googlebot pour le détail du schéma reverse DNS.

Quand un crawler revendiqué ne peut pas être vérifié, les signaux de repli sont les signaux ordinaires : l'adresse est-elle une plage de datacenter qui n'appartient pas à l'opérateur revendiqué, l'empreinte TLS correspond-elle au client revendiqué, les en-têtes sont-ils cohérents. Agentscan fait cela par requête, confirme les crawlers vérifiés dans les deux sens, compare aux plages publiées, et croise l'origine IP avec JA4 et les marqueurs headless pour renvoyer humain, bot connu, agent IA ou automatisation malveillante. Les verdicts sont mis en cache, les vérifications répétées reviennent donc en moins de 50 ms.

L'essentiel

Cloudflare a déplacé la valeur par défaut deux fois, et le second déplacement tombe le 15 septembre 2026. Vérifiez le réglage actuel de votre zone plutôt que de supposer ce qu'il devrait être. Décidez séparément pour l'entraînement, la récupération et le trafic d'agent, car les réduire à un seul interrupteur est exactement ce qui vous retire discrètement des réponses IA. Publiez votre intention dans robots.txt avec Content Signals, appliquez la politique correspondante à l'edge, autorisez par token exact les crawlers que vous voulez, et vérifiez chacun d'eux contre des plages publiées ou du reverse DNS plutôt que contre un en-tête que n'importe qui peut taper.

FAQ

Questions fréquentes

Oui, pour les nouveaux domaines. Cloudflare a annoncé le 1er juillet 2025 que les domaines nouvellement intégrés refusent l'accès aux crawlers IA tant que le propriétaire ne l'active pas, faisant passer le plus grand CDN du web de l'opt-out à l'opt-in. Un second changement arrive le 15 septembre 2026 : le trafic d'entraînement et d'agent est bloqué par défaut sur les pages qui affichent de la publicité, pour les nouveaux clients et pour les comptes gratuits qui n'ont pas modifié le réglage.

Articles associés