Cloudflare lanza “Accountable Mixed‑Use AI Crawlers”: cómo bloquear el scraping de IA sin perder SEO
Introducción
¿Te preocupa que tu contenido sea usado por modelos de IA sin tu permiso? Desde junio 2024 Cloudflare incluye una nueva categoría — Accountable Mixed‑Use AI Crawlers — que permite bloquear a esos bots con un solo clic. En este artículo verás, paso a paso y con ejemplos listos para copiar, cómo proteger tu sitio, mantener el tráfico orgánico y cumplir con la normativa europea y estadounidense.
1. ¿Qué es un “AI crawler” y por qué difiere de un bot de búsqueda?
| Característica | Bot de búsqueda (Google, Bing) | AI crawler (GPT‑4, Stable Diffusion, etc.) |
|---|---|---|
| Objetivo | Indexar páginas para mostrarlas en resultados. | Recopilar datos para entrenar modelos de IA. |
Respeto a robots.txt |
Sí, sigue las reglas al pie de la letra. | Muchas veces ignora robots.txt y extrae todo el contenido. |
| Velocidad | Limita la tasa de peticiones para no sobrecargar el servidor. | Puede lanzar cientos de peticiones por segundo. |
| Identificación | User‑Agent claro (Googlebot, Bingbot). |
User‑Agent variable, a veces “Mozilla/5.0 …”, a veces sin encabezado. |
En la práctica, los AI crawlers se comportan como “mixed‑use”: combinan la indexación con una extracción masiva de texto, imágenes y metadatos.
2. ¿Bloquear a los AI crawlers afecta al SEO?
No, siempre que la regla se limite a los agentes sospechosos y se mantenga libre el acceso a los bots de los buscadores. De hecho, al reducir la carga innecesaria del servidor mejoras la velocidad de carga, un factor positivo para el ranking.
3. Marco legal rápido
| Región | Norma | Qué obliga | Sanción típica |
|---|---|---|---|
| UE | GDPR + Directiva DSM | Impedir la reutilización no autorizada de obras protegidas. | Hasta 20 M € o 4 % del volumen de negocio anual. |
| EE. UU | DMCA | Permite enviar takedown notices contra sitios que hospeden contenido extraído sin permiso. | Sanciones civiles y, en casos graves, multas por infracción de derechos de autor. |
4. Configuración práctica en Cloudflare
4.1. Activar la categoría “Accountable Mixed‑Use AI Crawlers”
- En el panel de Cloudflare, abre Firewall → Tools.
- Busca “Accountable Mixed‑Use AI Crawlers” y actívalo.
- Selecciona “Block” como acción por defecto.
Tip: Si tu sitio depende de algún crawler legítimo que Cloudflare clasifique como “mixed‑use”, añádelo a la lista de excepciones antes de bloquear.
4.2. Regla de firewall personalizada (ejemplo)
(Field: http.user_agent contains "GPTBot")
or (Field: http.user_agent contains "Claude")
or (Field: http.user_agent contains "Bard")
or (Field: http.request.headers["sec-fetch-dest"] eq "empty")
then Block
Copia y pega la regla en Firewall → Rules → Create a Firewall Rule.
4.3. Desafío JavaScript opcional
Si prefieres un enfoque menos agresivo, muestra un JavaScript Challenge solo a los sospechosos:
(Field: http.user_agent contains "GPTBot")
or (Field: http.user_agent contains "Claude")
then Challenge (JS)
Los bots que no ejecuten JavaScript fallarán el desafío y serán bloqueados automáticamente.
4.4. Verificar que los bots de búsqueda siguen funcionando
Crea una regla de “Allow” específica para los principales buscadores:
(Field: http.user_agent eq "Googlebot")
or (Field: http.user_agent eq "Bingbot")
then Allow
Coloca esta regla por encima de la regla de bloqueo para que tenga prioridad.
5. Implementación en el servidor (opcional)
Si prefieres reforzar la defensa desde tu propio servidor, añade estas directivas a tu archivo .htaccess (Apache) o al bloque server de Nginx.
Apache (.htaccess)
# Bloquear AI crawlers conocidos
SetEnvIfNoCase User-Agent "GPTBot|Claude|Bard" block_ai
Deny from env=block_ai
# Permitir Google y Bing
SetEnvIfNoCase User-Agent "Googlebot|Bingbot" allow_se
Allow from env=allow_se
Nginx (nginx.conf)
# Bloquear AI crawlers
if ($http_user_agent ~* "(GPTBot|Claude|Bard)") {
return 403;
}
# Permitir Google y Bing
if ($http_user_agent ~* "(Googlebot|Bingbot)") {
# nada, dejar pasar
}
6. Cómo comprobar que todo funciona
- Herramienta de Cloudflare → Firewall Events: revisa los eventos marcados como “Blocked”.
- Google Search Console → Cobertura: verifica que no aparecen errores de rastreo.
- cURL de prueba:
curl -I -A "GPTBot/1.0" https://tusitio.com
# Debería devolver 403
curl -I -A "Googlebot/2.1" https://tusitio.com
# Debería devolver 200
7. Buenas prácticas adicionales
| Acción | Por qué ayuda |
|---|---|
| Limita la tasa de peticiones (rate limiting) | Evita que un crawler masivo saturé tu servidor. |
Usa Content‑Security‑Policy restrictiva |
Reduce la posibilidad de que scripts externos extraigan datos. |
Marca tu contenido con © y metadatos de derechos |
Facilita la identificación legal en caso de disputa. |
| Mantén actualizado el listado de AI crawlers | Cloudflare y la comunidad publican nuevas firmas regularmente. |
Conclusión
Con la nueva categoría Accountable Mixed‑Use AI Crawlers de Cloudflare puedes detener la extracción masiva de datos sin sacrificar la visibilidad en buscadores. Configura las reglas de firewall, refuerza la protección a nivel de servidor y verifica periódicamente que los bots legítimos siguen accediendo sin problemas. Así cumples con GDPR, DMCA y otras normativas, y mantienes tu sitio rápido y seguro.
¡Pon en práctica estos pasos hoy mismo y protege tu contenido de la IA no autorizada!
Herramienta mencionada: DigitalOcean
Top comments (0)