DEV Community

LeoJulieta
LeoJulieta

Posted on

Bloquea Scrapers de IA con Cloudflare sin dañar tu SEO

Cloudflare lanza “Accountable Mixed‑Use AI Crawlers”: cómo bloquear el scraping de IA sin perder SEO

Introducción

¿Te preocupa que tu contenido sea usado por modelos de IA sin tu permiso? Desde junio 2024 Cloudflare incluye una nueva categoría — Accountable Mixed‑Use AI Crawlers — que permite bloquear a esos bots con un solo clic. En este artículo verás, paso a paso y con ejemplos listos para copiar, cómo proteger tu sitio, mantener el tráfico orgánico y cumplir con la normativa europea y estadounidense.


1. ¿Qué es un “AI crawler” y por qué difiere de un bot de búsqueda?

Característica Bot de búsqueda (Google, Bing) AI crawler (GPT‑4, Stable Diffusion, etc.)
Objetivo Indexar páginas para mostrarlas en resultados. Recopilar datos para entrenar modelos de IA.
Respeto a robots.txt Sí, sigue las reglas al pie de la letra. Muchas veces ignora robots.txt y extrae todo el contenido.
Velocidad Limita la tasa de peticiones para no sobrecargar el servidor. Puede lanzar cientos de peticiones por segundo.
Identificación User‑Agent claro (Googlebot, Bingbot). User‑Agent variable, a veces “Mozilla/5.0 …”, a veces sin encabezado.

En la práctica, los AI crawlers se comportan como “mixed‑use”: combinan la indexación con una extracción masiva de texto, imágenes y metadatos.


2. ¿Bloquear a los AI crawlers afecta al SEO?

No, siempre que la regla se limite a los agentes sospechosos y se mantenga libre el acceso a los bots de los buscadores. De hecho, al reducir la carga innecesaria del servidor mejoras la velocidad de carga, un factor positivo para el ranking.


3. Marco legal rápido

Región Norma Qué obliga Sanción típica
UE GDPR + Directiva DSM Impedir la reutilización no autorizada de obras protegidas. Hasta 20 M € o 4 % del volumen de negocio anual.
EE. UU DMCA Permite enviar takedown notices contra sitios que hospeden contenido extraído sin permiso. Sanciones civiles y, en casos graves, multas por infracción de derechos de autor.

4. Configuración práctica en Cloudflare

4.1. Activar la categoría “Accountable Mixed‑Use AI Crawlers”

  1. En el panel de Cloudflare, abre Firewall → Tools.
  2. Busca “Accountable Mixed‑Use AI Crawlers” y actívalo.
  3. Selecciona “Block” como acción por defecto.

Tip: Si tu sitio depende de algún crawler legítimo que Cloudflare clasifique como “mixed‑use”, añádelo a la lista de excepciones antes de bloquear.

4.2. Regla de firewall personalizada (ejemplo)

(Field: http.user_agent contains "GPTBot")
or (Field: http.user_agent contains "Claude")
or (Field: http.user_agent contains "Bard")
or (Field: http.request.headers["sec-fetch-dest"] eq "empty")
then Block
Enter fullscreen mode Exit fullscreen mode

Copia y pega la regla en Firewall → Rules → Create a Firewall Rule.

4.3. Desafío JavaScript opcional

Si prefieres un enfoque menos agresivo, muestra un JavaScript Challenge solo a los sospechosos:

(Field: http.user_agent contains "GPTBot")
or (Field: http.user_agent contains "Claude")
then Challenge (JS)
Enter fullscreen mode Exit fullscreen mode

Los bots que no ejecuten JavaScript fallarán el desafío y serán bloqueados automáticamente.

4.4. Verificar que los bots de búsqueda siguen funcionando

Crea una regla de “Allow” específica para los principales buscadores:

(Field: http.user_agent eq "Googlebot")
or (Field: http.user_agent eq "Bingbot")
then Allow
Enter fullscreen mode Exit fullscreen mode

Coloca esta regla por encima de la regla de bloqueo para que tenga prioridad.


5. Implementación en el servidor (opcional)

Si prefieres reforzar la defensa desde tu propio servidor, añade estas directivas a tu archivo .htaccess (Apache) o al bloque server de Nginx.

Apache (.htaccess)

# Bloquear AI crawlers conocidos
SetEnvIfNoCase User-Agent "GPTBot|Claude|Bard" block_ai
Deny from env=block_ai

# Permitir Google y Bing
SetEnvIfNoCase User-Agent "Googlebot|Bingbot" allow_se
Allow from env=allow_se
Enter fullscreen mode Exit fullscreen mode

Nginx (nginx.conf)

# Bloquear AI crawlers
if ($http_user_agent ~* "(GPTBot|Claude|Bard)") {
    return 403;
}

# Permitir Google y Bing
if ($http_user_agent ~* "(Googlebot|Bingbot)") {
    # nada, dejar pasar
}
Enter fullscreen mode Exit fullscreen mode

6. Cómo comprobar que todo funciona

  1. Herramienta de CloudflareFirewall Events: revisa los eventos marcados como “Blocked”.
  2. Google Search ConsoleCobertura: verifica que no aparecen errores de rastreo.
  3. cURL de prueba:
curl -I -A "GPTBot/1.0" https://tusitio.com
# Debería devolver 403
curl -I -A "Googlebot/2.1" https://tusitio.com
# Debería devolver 200
Enter fullscreen mode Exit fullscreen mode

7. Buenas prácticas adicionales

Acción Por qué ayuda
Limita la tasa de peticiones (rate limiting) Evita que un crawler masivo saturé tu servidor.
Usa Content‑Security‑Policy restrictiva Reduce la posibilidad de que scripts externos extraigan datos.
Marca tu contenido con © y metadatos de derechos Facilita la identificación legal en caso de disputa.
Mantén actualizado el listado de AI crawlers Cloudflare y la comunidad publican nuevas firmas regularmente.

Conclusión

Con la nueva categoría Accountable Mixed‑Use AI Crawlers de Cloudflare puedes detener la extracción masiva de datos sin sacrificar la visibilidad en buscadores. Configura las reglas de firewall, refuerza la protección a nivel de servidor y verifica periódicamente que los bots legítimos siguen accediendo sin problemas. Así cumples con GDPR, DMCA y otras normativas, y mantienes tu sitio rápido y seguro.

¡Pon en práctica estos pasos hoy mismo y protege tu contenido de la IA no autorizada!


Herramienta mencionada: DigitalOcean

Top comments (0)