Las mejores señales para la detección de bots (clasificadas)
No todas las señales de detección de bots son igual de fiables. Estas son las señales de IP, red y comportamiento más útiles, clasificadas por fiabilidad, para detectar tráfico automatizado.
No existe una única prueba de "¿esto es un bot?", pero la fiabilidad de las señales disponibles varía bastante. Así se pueden clasificar para dedicar el esfuerzo donde realmente compensa.
Nivel 1: origen de red (el más fuerte, el más barato)
La mayor parte del tráfico automatizado proviene de infraestructura que se delata a sí misma:
- ASN de datacenter o hosting. Un "visitante" en un servidor en la nube es el indicio clásico de bot, ver qué es un ASN.
- Uso de proxy. HTTP/SOCKS, proxies residenciales y de datacenter, mediante la API de detección de proxy.
- VPN y Tor. Anonimizadores que ocultan el origen.
- Reputación de IP. Abusos previos desde la dirección o el rango.
Una sola consulta de IP cubre todo esto, por eso el origen de red es el nivel con mayor rendimiento.
Comprobar una IP en busca de señales de red relacionadas con bots
Nivel 2: señales de comportamiento (detecta los casos sofisticados)
Para los bots que usan proxies residenciales e imitan a humanos, el comportamiento los delata:
- Velocidad y volumen de solicitudes.
- Patrones de navegación que ningún humano produce (cada página en secuencia).
- Comportamiento de cliente ausente: sin ejecución de JS, sin eventos de ratón o táctiles.
- Ritmo demasiado rápido o demasiado regular.
Nivel 3: indicios débiles (usar con cautela)
- Cadenas de user-agent: fáciles de falsificar.
- Anomalías aisladas en cabeceras: sugerentes, no concluyentes.
- Listas de bloqueo de IP sin procesar: quedan obsoletas rápido, ver por qué las listas de bloqueo de IP gratuitas no bastan.
Cómo combinarlas
El orden importa porque indica cómo ponderar cada señal:
| Nivel | Peso | Por qué |
|---|---|---|
| Origen de red | Alto | Barato, detecta la mayor parte |
| Comportamiento | Alto para bots sigilosos | Detecta bots con proxy residencial |
| Indicios débiles | Bajo | Falsificables / se quedan obsoletos |
Incorpora las señales de red en un puntaje de fraude de IP y luego suma comportamiento para el resto. Ver cómo detectar bots por dirección IP para el enfoque que empieza por la IP.
En resumen
Clasifica tus señales de bots: el origen de red (proxy/VPN/hosting/reputación) es el primer filtro más fuerte y más barato; las señales de comportamiento detectan los bots sofisticados con proxy residencial; los user agents y las listas de bloqueo estáticas son indicios débiles. Combina los dos niveles superiores y da poco peso al resto.