Cómo verificar Googlebot (y bloquear los bots que lo imitan)
Cualquiera puede enviar un User-Agent de Googlebot. Así se verifica el Googlebot real con DNS inverso, y así se distinguen bots verificados, crawlers de IA y automatización maliciosa.
"Verify Googlebot" es una de las preguntas sobre bots más buscadas, y con razón: buena parte del tráfico no deseado llega disfrazado de Googlebot. El User-Agent es trivial de falsificar, así que tratarlo como prueba es lo que permite a los scrapers obtener el mismo pase libre que el crawler real.
El User-Agent no demuestra nada
Googlebot/2.1 es solo un header. Un scraper, un navegador headless o un script de credential
stuffing pueden enviar exactamente la misma cadena. Si tu regla de permiso es "el User-Agent
contiene Googlebot", en la práctica has publicado una puerta abierta con un cartel que dice no
pasar.
La verificación real: DNS inverso forward-confirmed
Google publica el método, y consta de tres pasos:
- Búsqueda inversa de la IP. Toma la IP que se conecta y lee su registro PTR. El Googlebot
real resuelve a un hostname bajo
googlebot.comogoogle.com. - Confirmar el dominio. El hostname debe terminar en uno de esos dominios oficiales. Una IP de datacenter que dice ser Googlebot suele tener un PTR que no cumple esto.
- Búsqueda directa de regreso. Resuelve ese hostname a una IP y confirma que coincide con la original. Esto cierra el ciclo, de modo que un registro PTR falsificado por sí solo no basta.
Una solicitud de "Googlebot" que falla en cualquiera de los pasos no es Googlebot. El mismo patrón verifica a Bingbot, y los demás grandes crawlers publican sus propios rangos o convenciones de DNS.
Ya no se trata solo de Googlebot
El problema más difícil en 2026 es todo lo que está entre lo humano y el bot evidente.
- Crawlers de IA como GPTBot, ClaudeBot y PerplexityBot, que quizá quieras permitir, monetizar o bloquear por nombre.
- Automatización headless (Playwright, Puppeteer, HeadlessChrome) que imita un navegador real de forma convincente.
- Bots buenos suplantados que circulan con User-Agents falsificados desde rangos de datacenter.
El DNS inverso verifica a los bots buenos. Por sí solo, no clasifica el resto.
Combinar señales para clasificar el resto
Verificar Googlebot es una sola señal. Para decidir sobre todo lo demás, combínala con:
- Origen de la IP: datacenter, VPN, proxy o residencial limpio. El tráfico headless desde un rango de datacenter es el caso clásico de automatización maliciosa. Revisa primero la reputación y el origen de una IP.
- Señales de headless y automatización:
webdriver, superficies de navegador ausentes y marcadores de User-Agent como HeadlessChrome. - Huella TLS JA4: refleja cómo habla realmente TLS el cliente, así que sobrevive a un User-Agent falsificado y distingue un Chrome real de un impostor.
- Consistencia de headers: los navegadores reales envían Accept, Accept-Language y Accept-Encoding juntos, muchos bots no lo hacen.
Permite a los reales, decide sobre el resto
| Solicitud | Verificación | Acción |
|---|---|---|
| Googlebot, DNS inverso confirmado | Verificado | Permitir |
| Crawler de IA, identificado por nombre | Conocido | Permitir, monetizar o bloquear según política |
| Headless desde un datacenter | Sin identidad confiable | Bloquear |
| Googlebot suplantado, DNS inverso falla | Fallido | Bloquear |
Ese es el modelo que Agentscan ejecuta en una sola solicitud: confirma la allowlist verificada mediante DNS inverso forward-confirmed, identifica los crawlers de IA por nombre, y combina el origen de la IP con señales headless y JA4 para clasificar cada solicitud como humano, bot conocido, agente de IA o automatización maliciosa. Los veredictos se almacenan en caché, así que las búsquedas repetidas regresan en menos de 50ms.
En resumen
Nunca confíes en un User-Agent de Googlebot. Verifícalo con DNS inverso forward-confirmed, permite los crawlers que realmente quieres y combina origen de la IP, señales headless y JA4 para decidir sobre todo lo demás. Así proteges el SEO y bloqueas los falsos al mismo tiempo.