Hoe je Googlebot verifieert (en nep-bots blokkeert)
Iedereen kan een Googlebot User-Agent sturen. Zo verifieer je echte Googlebot met reverse DNS, en zo onderscheid je geverifieerde bots, AI-crawlers en kwaadaardige automatisering.
"Verify Googlebot" is een van de meest gezochte bot-vragen, met reden: een groot deel van het ongewenste verkeer arriveert vermomd als Googlebot. De User-Agent is triviaal te vervalsen, dus door hem als bewijs te behandelen krijgen scrapers dezelfde vrijbrief als de echte crawler.
De User-Agent bewijst niets
Googlebot/2.1 is gewoon een header. Een scraper, een headless browser of een credential-stuffing-
script kan exact dezelfde string versturen. Als je allow-regel "User-Agent bevat Googlebot" is, heb
je in feite een open deur gepubliceerd met een bordje "niet binnenkomen".
De echte check: forward-confirmed reverse DNS
Google publiceert de methode, en die bestaat uit drie stappen:
- Reverse lookup van het IP. Neem het verbindende IP-adres en lees het PTR-record. Echte
Googlebot resolvt naar een hostname onder
googlebot.comofgoogle.com. - Bevestig het domein. De hostname moet eindigen op een van die officiële domeinen. Een datacenter-IP dat beweert Googlebot te zijn, heeft meestal een PTR-record dat dat niet doet.
- Forward lookup terug. Resolve die hostname naar een IP-adres en bevestig dat het overeenkomt met het origineel. Dit sluit de cirkel, zodat een vervalst PTR-record alleen niet volstaat.
Een "Googlebot"-verzoek dat een van de stappen niet doorstaat, is geen Googlebot. Hetzelfde patroon verifieert Bingbot, en de andere grote crawlers publiceren hun eigen bereiken of DNS-conventies.
Het gaat allang niet meer alleen om Googlebot
Het lastigere probleem in 2026 is alles daartussenin: tussen mens en overduidelijke bot.
- AI-crawlers zoals GPTBot, ClaudeBot en PerplexityBot, die je misschien wilt toestaan, monetariseren of juist op naam wilt blokkeren.
- Headless automatisering (Playwright, Puppeteer, HeadlessChrome) die overtuigend een echte browser imiteert.
- Gespoofte goede bots met vervalste User-Agents vanuit datacenterbereiken.
Reverse DNS verifieert de goede bots. Op zichzelf classificeert het de rest niet.
Signalen stapelen om de rest te classificeren
Googlebot verifiëren is één signaal. Om over al het andere te beslissen, combineer je het met:
- IP-herkomst: datacenter, VPN, proxy of schoon residentieel IP. Headless verkeer vanuit een datacenterbereik is het schoolvoorbeeld van kwaadaardige automatisering. Controleer eerst de reputatie en herkomst van een IP.
- Headless- en automatiseringssignalen:
webdriver, ontbrekende browservlakken en User-Agent- markers zoals HeadlessChrome. - JA4 TLS-fingerprint: weerspiegelt hoe de client daadwerkelijk TLS spreekt, overleeft dus een vervalste User-Agent en onderscheidt een echte Chrome van een bedrieger.
- Header-consistentie: echte browsers sturen Accept, Accept-Language en Accept-Encoding samen, veel bots doen dat niet.
Sta de echte toe, beslis over de rest
| Verzoek | Verificatie | Actie |
|---|---|---|
| Googlebot, reverse DNS bevestigd | Geverifieerd | Toestaan |
| AI-crawler, geïdentificeerd op naam | Bekend | Toestaan, monetariseren of blokkeren volgens beleid |
| Headless vanuit een datacenter | Geen goede identiteit | Blokkeren |
| Gespoofte Googlebot, reverse DNS mislukt | Mislukt | Blokkeren |
Dat is het model dat Agentscan in één verzoek doorloopt: het bevestigt de geverifieerde allowlist via forward-confirmed reverse DNS, identificeert AI-crawlers op naam en combineert IP-herkomst met headless-signalen en JA4 om elk verzoek te classificeren als mens, bekende bot, AI-agent of kwaadaardige automatisering. Verdicts worden gecached, dus herhaalde lookups komen terug in minder dan 50ms.
Kortom
Vertrouw nooit een Googlebot User-Agent. Verifieer hem met forward-confirmed reverse DNS, sta de crawlers toe die je echt wilt, en combineer IP-herkomst, headless-signalen en JA4 om over al het andere te beslissen. Zo bescherm je SEO en blokkeer je tegelijk de nepversies.