🔥 Polémica
Los 'bots de IA' que escanean tu web no son lo que crees: alguien los está suplantando
Tu sitio web recibió esta semana miles de visitas de ClaudeBot, GPTBot y otros robots de inteligencia artificial. ¿El problema? No eran ellos. Alguien está suplantando la identidad de los bots de IA más famosos para escanear servidores en masa y buscar vulnerabilidades.
La señal de alarma: escaneos masivos con identidad robada
Un análisis de Known Agents, una firma que monitorea tráfico de agentes en más de 5,000 sitios, detectó un aumento repentino de escaneos que fallan la verificación de identidad: dicen ser bots conocidos, pero las IP no coinciden con las de Anthropic, OpenAI ni Google.
El hallazgo explotó en Hacker News con 240 puntos y 181 comentarios en horas. Y no fue un caso aislado: varios administradores de sistemas confirmaron el mismo patrón en sus servidores durante la última semana.
"Muchos de esos user-agents están falsificados. Mira qué ASN es dueño de su IP. Si bloqueas la mayoría de proveedores VPS, los bots falsos desaparecen", escribió un sysadmin en el hilo.
7.9 mil millones de peticiones y una industria ciega
No es solo una anécdota de foro. La firma de seguridad DataDome registró 7.9 mil millones de peticiones de agentes de IA entre enero y febrero de 2026, un 5% más que el trimestre anterior. Para un solo cliente, el tráfico de agentes representó el 9.75% de todas las peticiones en 30 días.
Y la suplantación ya es un negocio en marcha:
- Meta-externalagent fue el bot más suplantado: 16.4 millones de peticiones falsas.
- ChatGPT-User le sigue con 7.9 millones de spoofs detectados.
- PerplexityBot tiene la tasa de fraude más alta: casi 2.4% de lo que dice ser él es falso.
Por qué funciona el truco (y asusta)
La mayoría de sitios usa allowlists por user-agent: si el navegador se presenta como GPTBot, entra. Punto. No verifican IP, ni certificados, ni comportamiento.
Eso convierte la lista blanca en una puerta abierta: el atacante pone "ClaudeBot" en el header HTTP y consigue acceso a rutas que bloquean a humanos y bots desconocidos. Los escaneos detectados apuntan, según el hilo de HN, a caminos relacionados con herramientas de coding de IA.
Lo peor: más de la mitad del tráfico sospechoso viene de IPs propiedad de Microsoft y Google, lo que complica los bloqueos por reputación. Los atacantes abusan de infraestructura legítima para esconderse.
Cómo protegerte (antes de que te escaneen a ti)
Para devs y dueños de webs en LATAM, la lección es directa:
- No confíes en el user-agent. Es un string que cualquiera puede inventar. Verifica la IP contra los rangos oficiales publicados por cada empresa de IA.
- Bloquea proveedores VPS sospechosos en nginx o Caddy si no necesitas tráfico de datacenters.
- Revisa tus logs: picos de peticiones a rutas de admin, config o API desde un mismo bloque de IP son bandera roja.
- Usa servicios de bot management (Cloudflare, DataDome) que validan identidad real, no solo el header.
La verdad incómoda
La era de los agentes de IA trae un efecto colateral que nadie esperaba: la identidad de los bots se volvió un disfraz perfecto. Los firewalls que confiaban en "quién te visita" ahora no pueden saber ni quién llama a la puerta.
Mientras las empresas de IA publican guías de verificación, los atacantes ya están un paso adelante. Tu servidor es el campo de batalla. ¿Ya revisaste tus logs de hoy?
Comparte esto con alguien que todavía cree que bloquear a GPTBot es suficiente.