📱 Tutorial
Adiós a los bots de IA: cómo proteger tu web de los crawlers que se roban tu contenido
Los bots de inteligencia artificial están devorando internet. No es metáfora. Patreon acaba de dejar de "pedir amablemente" que no le roben contenido y pasó a bloquearlos activamente. Cloudflare reporta crawlers que golpean sitios web 50,000 veces por visitante real. Y millones de páginas están pagando servidores para alimentar gratis a empresas valuadas en billones de dólares.
Pero hay esperanza. Existen formas de bloquear a estos parásitos digitales sin pagar Cloudflare Enterprise. Y te las voy a enseñar.
El problema: la IA está consumiendo tu ancho de banda
No es paranoia. En julio 2026, Cloudflare reveló que algunos crawlers de IA están generando hasta 50,000 requests por cada visitante humano real en sitios pequeños y medianos. Eso se traduce en facturas de hosting que se disparan y sitios que se vuelven lentos para usuarios legítimos.
Patreon, la plataforma de suscripción de creadores, pasó de la súplica a la acción: eliminó su robots.txt "amigable" y bloqueó activamente a los crawlers de IA usando las nuevas herramientas de Cloudflare. TechCrunch reportó la movida como un punto de inflexión en la guerra entre creadores de contenido y empresas de IA.
La mentira del robots.txt
Por años nos dijeron que robots.txt era suficiente. Mentira. Es un archivo de texto sin ninguna fuerza vinculante. Es como poner un cartel de "no pasar" en una autopista — los bots de IA lo ignoran porque no hay ninguna consecuencia legal por hacerlo.
Empresas como Perplexity fueron pilladas in fraganti scrapeando sitios web que explícitamente los bloqueaban en robots.txt. TechCrunch documentó el caso: Perplexity seguía accediendo a contenido bloqueado, y cuando los atraparon, básicamente dijeron "ups, fue un error".
La lección es clara: robots.txt no bloquea nada. Solo es una señal de tránsito que nadie respeta.
Método 1: Bloqueo por User-Agent (gratis, parcial)
El método más básico es bloquear por User-Agent en tu servidor. En Apache, agregás al .htaccess:
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} (GPTBot|ChatGPT-User|Claude-Web|Google-Extended|CCBot|anthropic-ai|Amazonbot) [NC]
RewriteRule .* - [F,L]
En Nginx, funciona similar. Pero ojo: los bots avanzados ya están usando User-Agent falsos haciéndose pasar por Chrome real. Este método solo frena a los honestos.
Método 2: Cloudflare gratuito (el más potente)
Cloudflare tiene un plan gratuito que incluye su firewall y ahora también control granular de crawlers de IA. En julio 2026 lanzaron AI Crawler Rules que permiten:
- ✅ Bloquear todos los crawlers de IA de golpe
- ✅ Separar crawlers de búsqueda (Googlebot) de crawlers de entrenamiento (GPTBot)
- ✅ Permitir unos y bloquear otros
- ✅ Ver estadísticas de cuánto te están golpeando
Lo mejor: es gratis. En el dashboard de Cloudflare, vas a Security → AI Crawlers y activás el bloqueo. En segundos dejás de alimentar a las máquinas.
Bonus: A partir de septiembre 2026, Cloudflare planea bloquear por defecto los bots de uso mixto (los que scrapean para búsqueda Y entrenamiento) en sitios con anuncios, forzando a las empresas de IA a pagar por el contenido. Esto es un game changer.
Método 3: Rate limiting + challenges
Los bots de IA no se comportan como humanos. Hacen cientos de requests por minuto desde la misma IP. Podés configurar rate limiting en tu servidor o CDN para:
- 🔹 Limitar requests por IP: 100 requests/minuto como máximo
- 🔹 Captcha después de X requests: Si una IP hace 50 requests en 5 minutos, mandale un challenge
- 🔹 Bloquear IPs de datacenters conocidos: AWS, GCP, Azure, OVH — los bots de IA casi siempre vienen de ahí
Nginx tiene ngx_http_limit_req_module. Cloudflare tiene Rate Limiting (300 requests gratis/día). Ambos funcionan.
Método 4: Honeypots y trampas
El método más creativo viene de la comunidad de HN. Algunos administradores están colocando enlaces invisibles (display:none) que solo los bots siguen. Cuando un crawler cae en la trampa, se registra su IP y se bloquea automáticamente.
Otro truco: servir un HTML gigante (10MB+) a los bots sospechosos para que consuman su propio ancho de banda en vez del tuyo. Es vengativo pero satisfactorio.
¿Y si no tengo sitio técnico?
Si tenés un blog en WordPress, Squarespace o Wix, estas plataformas están empezando a integrar estas protecciones. WordPress tiene plugins como Wordfence y AI Scraper Blocker que funcionan sin tocar código. Beehiiv también se sumó, integrando el AI Crawl Control de Cloudflare para escritores.
Pero si querés la máxima protección: pasate a Cloudflare gratis. Es el paso más simple y efectivo que podés dar hoy.
La guerra recién empieza
Esto no se va a resolver con tecnología. Las empresas de IA necesitan datos frescos para entrenar sus modelos, y los creadores de contenido necesitan que su trabajo no sea robado. Es una contradicción fundamental.
Cloudflare está tratando de construir un puente: que las empresas de IA paguen por el contenido que consumen. Pero mientras eso no sea ley, la única defensa que tenés sos vos y las herramientas que te mostré acá.
Mi recomendación: implementá el bloqueo HOY. Cada día que pasa sin protección, tus servidores están trabajando para enriquecer a empresas que no te pagan un centavo.
Compartí esto con alguien que tenga un sitio web y no sepa que lo están vaciando.