<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>DEV Community: Nicolas Boites</title>
    <description>The latest articles on DEV Community by Nicolas Boites (@nickboites).</description>
    <link>https://dev.to/nickboites</link>
    <image>
      <url>https://media2.dev.to/dynamic/image/width=90,height=90,fit=cover,gravity=auto,format=auto/https:%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F3340199%2F2d64832e-c607-45b6-80e8-04d57ed5165f.jpg</url>
      <title>DEV Community: Nicolas Boites</title>
      <link>https://dev.to/nickboites</link>
    </image>
    <atom:link rel="self" type="application/rss+xml" href="https://dev.to/feed/nickboites"/>
    <language>en</language>
    <item>
      <title>Por qué falló Grok: lecciones de ingeniería y guardrails</title>
      <dc:creator>Nicolas Boites</dc:creator>
      <pubDate>Mon, 14 Jul 2025 21:26:42 +0000</pubDate>
      <link>https://dev.to/nickboites/por-que-fallo-grok-lecciones-de-ingenieria-y-guardrails-2olj</link>
      <guid>https://dev.to/nickboites/por-que-fallo-grok-lecciones-de-ingenieria-y-guardrails-2olj</guid>
      <description>&lt;p&gt;&lt;iframe class="tweet-embed" id="tweet-1942720721026699451-268" src="https://platform.twitter.com/embed/Tweet.html?id=1942720721026699451"&gt;
&lt;/iframe&gt;

  // Detect dark theme
  var iframe = document.getElementById('tweet-1942720721026699451-268');
  if (document.body.className.includes('dark-theme')) {
    iframe.src = "https://platform.twitter.com/embed/Tweet.html?id=1942720721026699451&amp;amp;theme=dark"
  }



&lt;/p&gt;

&lt;h2&gt;
  
  
  1. Resumen
&lt;/h2&gt;

&lt;p&gt;Entre el &lt;strong&gt;7 y 9 de julio de 2025&lt;/strong&gt; el chatbot &lt;strong&gt;Grok&lt;/strong&gt;, de xAI, publicó en X una serie de respuestas que elogiaban a Adolf Hitler y repetían teorías conspirativas antisemitas. La reacción fue inmediata: los mensajes se borraron, la cuenta se puso “en revisión” y el debate sobre los riesgos de la IA volvió a encenderse.&lt;br&gt;
Lo relevante es que &lt;strong&gt;no hubo hackeo&lt;/strong&gt;: la cadena de fallos se originó en decisiones de ingeniería mal concebidas y en la ausencia de controles básicos de calidad.&lt;/p&gt;




&lt;h2&gt;
  
  
  2. Cronología
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Fecha&lt;/th&gt;
&lt;th&gt;Qué ocurrió&lt;/th&gt;
&lt;th&gt;Detalle / impacto&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;7 jul 2025&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Se actualiza el &lt;em&gt;prompt&lt;/em&gt; de sistema para “ser más desafiante y sin autocensura”.&lt;/td&gt;
&lt;td&gt;Cambio directo en &lt;em&gt;main&lt;/em&gt; sin revisión, según filtraciones internas.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;8 jul 2025&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Usuarios detectan tuits de Grok que citan a Hitler como “figura histórica ideal” contra “odio antiblanco”.&lt;/td&gt;
&lt;td&gt;Capturas se viralizan y etiquetan a la Liga Antidifamación.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;9 jul 2025&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;xAI elimina mensajes y deshabilita a Grok para “investigación de seguridad”.&lt;/td&gt;
&lt;td&gt;Medios internacionales cubren el retiro de la IA.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;10 jul 2025&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Musk anuncia que “Grok 4” llegará con mejoras, pero sin detallar salvaguardas.&lt;/td&gt;
&lt;td&gt;En una transmisión en vivo promete un relanzamiento rápido; surgen críticas por apresurarse.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;




&lt;h2&gt;
  
  
  3. Causas
&lt;/h2&gt;

&lt;ol&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;RAG sin filtro&lt;/strong&gt;&lt;br&gt;
Grok mezclaba en tiempo real tuits recién publicados con la pregunta del usuario. Al no filtrar antes de indexar, cualquier mensaje tóxico se convertía en contexto “oficial” del modelo.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Prompt contradictorio&lt;/strong&gt;&lt;br&gt;
El ajuste del 7 de julio ordenó “no rehuir posturas políticamente incorrectas”, pero el prompt original también pedía evitar discurso de odio. Dos reglas opuestas en el mismo archivo: el modelo eligió la que ofrecía más novedad… y espectáculo.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Publicación automática&lt;/strong&gt;&lt;br&gt;
Una vez generada la respuesta, se tuiteaba tal cual. No había un paso intermedio que dijera “alto, revisemos el tono” ni humano en el proceso.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;DevOps&lt;/strong&gt;&lt;br&gt;
Los prompts vivían en GitHub, pero los cambios iban directo a producción: sin &lt;em&gt;pull-request&lt;/em&gt;, sin canary, sin rollback claro. Cualquier typo —o sesgo— impactaba a millones de usuarios al instante.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Gobernabilidad&lt;/strong&gt;&lt;br&gt;
Internamente se buscaba la “máxima veracidad” y minimizaba la moderación, vista como “censura”. Las advertencias de riesgo quedaron en segundo plano.&lt;/p&gt;&lt;/li&gt;
&lt;/ol&gt;




&lt;h3&gt;
  
  
  4  Mitigaciones en profundidad
&lt;/h3&gt;

&lt;p&gt;Cuando decimos que &lt;strong&gt;“Grok reventó por falta de guardrails”&lt;/strong&gt;, suena a frase hecha. Veamos, paso a paso, qué significa eso en la práctica y cómo se habría evitado el desastre con un puñado de decisiones técnicas sensatas.&lt;/p&gt;




&lt;h4&gt;
  
  
  4.1  Filtrado en la ingesta (RAG)
&lt;/h4&gt;

&lt;p&gt;&lt;strong&gt;El problema&lt;/strong&gt;&lt;br&gt;
Grok usaba &lt;em&gt;Retrieval-Augmented Generation&lt;/em&gt;: antes de responder, buscaba tuits recientes y los pegaba al prompt. Sin un colador, cualquier insulto o teoría conspirativa quedaba “empacada” junto con tu pregunta.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;La idea clave&lt;/strong&gt;&lt;br&gt;
Filtra &lt;strong&gt;antes&lt;/strong&gt; de que el texto llegue al vector store. Así evitas indexar basura y, de paso, ahorras tokens y facturas.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Cómo se hace&lt;/strong&gt;&lt;br&gt;
Un guardrail de ingesta es, literalmente, un clasificador que decide “pasa / no pasa”. Hoy no hace falta entrenarlo desde cero:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Amazon Bedrock Guardrails&lt;/strong&gt; ofrece un endpoint que etiqueta odio, violencia, sexo, etc., y te deja fijar umbrales. Basta un &lt;code&gt;POST&lt;/code&gt; con el texto y obtienes un score; si supera tu límite, lo descartas.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Azure AI Content Safety&lt;/strong&gt; hace algo similar, añade “prompt shields” contra inyecciones y ya viene integrado con los modelos de Azure OpenAI.&lt;/li&gt;
&lt;li&gt;¿Prefieres algo self-hosted? Modelos abiertos como Detoxify (RoBERTa) corren en GPU y clasifican ~50 k tokens/s, perfecto para un stream de Kafka.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;&lt;strong&gt;Moraleja&lt;/strong&gt;&lt;br&gt;
Si Grok hubiera frenado los tuits tóxicos &lt;em&gt;antes&lt;/em&gt; de indexarlos, nunca los habría citado.&lt;/p&gt;




&lt;h4&gt;
  
  
  4.2  Tratar el &lt;em&gt;prompt&lt;/em&gt; como código de producción
&lt;/h4&gt;

&lt;p&gt;&lt;strong&gt;El problema&lt;/strong&gt;&lt;br&gt;
El 7 de julio alguien cambió una línea del prompt en GitHub y todo se fue al carajo. No hubo revisión ni ambiente de pruebas.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;La idea clave&lt;/strong&gt;&lt;br&gt;
Un prompt es tan crítico como cualquier microservicio: se versiona, se prueba y se despliega de forma gradual.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Cómo se hace&lt;/strong&gt;&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;Versionado.&lt;/strong&gt; Plataformas como &lt;strong&gt;Pezzo&lt;/strong&gt; o &lt;strong&gt;PromptLayer&lt;/strong&gt; guardan tus prompts con control de versiones (tipo &lt;code&gt;v1.2.3&lt;/code&gt;), muestran diffs y registran quién cambió qué.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Evaluaciones automáticas.&lt;/strong&gt; Suites como &lt;strong&gt;Langfuse Evals&lt;/strong&gt; ejecutan casos límite (hate-speech, jailbreaks, factualidad) cada vez que abres un pull request. Si la nueva versión empeora el score, el PR se bloquea.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Feature flags.&lt;/strong&gt; Un cambio aprobado se despliega con un flag apagado. Primero lo activas para el 1 % de usuarios (“canary”) y observas métricas; si algo huele mal, lo apagas en segundos.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;&lt;strong&gt;Moraleja&lt;/strong&gt;&lt;br&gt;
Sin revisión de pares ni tests, el prompt de Grok era básicamente “código cowboy”. Bastaba un typo ideológico para incendiar todo.&lt;/p&gt;




&lt;h4&gt;
  
  
  4.3  Guardrails de salida
&lt;/h4&gt;

&lt;p&gt;&lt;strong&gt;El problema&lt;/strong&gt;&lt;br&gt;
Aun con filtrado en la ingesta, siempre puede colarse algo. Necesitas un último cortafuego &lt;em&gt;antes&lt;/em&gt; de publicar.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;La idea clave&lt;/strong&gt;&lt;br&gt;
Piensa en un “proxy moderador”: recibe la salida del LLM, la analiza y decide si la muestra, la silencia o la pide de nuevo.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Cómo se hace&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Flujo típico&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;

&lt;ol&gt;
&lt;li&gt;El LLM genera →&lt;/li&gt;
&lt;li&gt;Un middleware llama al servicio de moderación (Bedrock, Azure, etc.) →&lt;/li&gt;
&lt;li&gt;Si el score supera el umbral, aplica la política: bloquear, redactar o re-prompt.

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Umbrales ajustables.&lt;/strong&gt; Tal vez bloquees odio con 0.2 y violencia con 0.4; la idea es tunearlos según tu riesgo reputacional.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Trazabilidad.&lt;/strong&gt; Guarda el texto original, el score y la acción tomada. Esa bitácora es oro para auditorías y debugging.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;&lt;strong&gt;Ejemplo real&lt;/strong&gt;&lt;br&gt;
Bedrock Guardrails permite configurar “denied topics”; al detectar nazismo, devuelve una bandera que puedes usar para tumbar el mensaje.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Moraleja&lt;/strong&gt;&lt;br&gt;
Grok publicaba directo en X sin este proxy. Resultado: hitlerianos en prime time.&lt;/p&gt;




&lt;h4&gt;
  
  
  4.4  Observabilidad y bucle de retroalimentación
&lt;/h4&gt;

&lt;p&gt;&lt;strong&gt;El problema&lt;/strong&gt;&lt;br&gt;
Si no mides, no aprendes. Grok no tenía alarmas que avisaran “¡oye, la toxicidad subió 300 % en los últimos 5 minutos!”.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;La idea clave&lt;/strong&gt;&lt;br&gt;
Traza cada paso (retrieval, generación, moderación) y convierte esos eventos en métricas en tiempo real.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Cómo se hace&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Datos de telemetría.&lt;/strong&gt; Con &lt;strong&gt;OpenInference&lt;/strong&gt; y &lt;strong&gt;OpenTelemetry&lt;/strong&gt; puedes capturar datos sobre el comportamiento en tiempo real y enviarlos una herramienta de para su procesamiento.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Observabilidad.&lt;/strong&gt; Herramientas open-source como &lt;strong&gt;Arize Phoenix&lt;/strong&gt; pueden consumir esas trazas y muestrar dashboards con latencia, toxic-score y prompts más conflictivos.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Alertas.&lt;/strong&gt; Configurar herramientas como PagerDuty: “si hate-score &amp;gt; 0.15 durante 3 min, page a la on-call”. Así actuas &lt;em&gt;antes&lt;/em&gt; de que Twitter te te avise.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;&lt;strong&gt;Moraleja&lt;/strong&gt;&lt;br&gt;
La primera señal de que Grok estaba roto vino de los usuarios; con observabilidad habría venido de tus gráficos, mucho antes.&lt;/p&gt;




&lt;h4&gt;
  
  
  4.5  Despliegues graduales y rollback instantáneo
&lt;/h4&gt;

&lt;p&gt;&lt;strong&gt;El problema&lt;/strong&gt;&lt;br&gt;
Un cambio en &lt;em&gt;main&lt;/em&gt; impactaba al 100 % de usuarios. Cuando el prompt falló, ya era demasiado tarde.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;La idea clave&lt;/strong&gt;&lt;br&gt;
Libera en pequeños lotes (canary) y conserva un “botón rojo” para retroceder sin redeploy.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Cómo se hace&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Canary deployments.&lt;/strong&gt; Herramientas como &lt;strong&gt;Argo Rollouts&lt;/strong&gt; o &lt;strong&gt;LaunchDarkly&lt;/strong&gt; enrutan 1 % del tráfico a la nueva versión, observan métricas y, si todo va bien, incrementan al 5 %, 20 %, 50 %, 100 %.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Kill switch.&lt;/strong&gt; Los feature flags de LaunchDarkly actúan como interruptor: si el canary se porta mal, apagas el flag y el 100 % vuelve a la versión segura sin reconstruir contenedores.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Ventanas de congelamiento.&lt;/strong&gt; Durante eventos críticos (Black Friday, elecciones) simplemente prohíbe cambios en producción.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;&lt;strong&gt;Moraleja&lt;/strong&gt;&lt;br&gt;
Con un canary al 1 %, el tweet “Hitler era un líder visionario” jamás habría llegado a la portada. Habría muerto en el canary y el rollback habría sido cuestión de un clic.&lt;/p&gt;




&lt;h2&gt;
  
  
  5. Lista rápida de verificación antes de exponer tu IA al mundo
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;¿Filtras tu fuente?&lt;/strong&gt;&lt;br&gt;
RAG es potente, pero solo si el material que ingestas pasa por un filtro de toxicidad y PII. Si no, tu vector store se vuelve un basurero difícil de limpiar.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;¿Versionas y pruebas tu prompt?&lt;/strong&gt;&lt;br&gt;
Un prompt es código. Guárdalo, haz revisiones de pares y corre evaluaciones automáticas que midan toxicidad, factualidad y jailbreaks.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;¿Tienes guardrails de salida?&lt;/strong&gt;&lt;br&gt;
Pon un proxy moderador que revise cada respuesta. AWS Bedrock, Azure AI o tu propia función con Detoxify sirven de ejemplo; lo importante es el paso extra de control antes de publicar.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;¿Mides lo que importa?&lt;/strong&gt;&lt;br&gt;
Rastrea métricas como &lt;em&gt;toxic-score&lt;/em&gt;, latencia y número de bloqueos por minuto. Activa alertas para que el equipo de guardia se entere &lt;em&gt;antes&lt;/em&gt; que los usuarios.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;¿Despliegas en canary y con kill switch?&lt;/strong&gt;&lt;br&gt;
Empieza con 1 % de tráfico, observa, y solo entonces escala. Conserva un interruptor para volver en segundos a la versión estable si algo sale mal.&lt;/p&gt;&lt;/li&gt;
&lt;/ul&gt;




&lt;h2&gt;
  
  
  6. Conclusión
&lt;/h2&gt;

&lt;p&gt;El caso Grok demuestra que &lt;strong&gt;la ingeniería de IA no puede tratar la seguridad como un plus opcional&lt;/strong&gt;. Con cinco buenas prácticas —filtrado de ingesta, prompts versionados, guardrails de salida, observabilidad en tiempo real y despliegues graduales— el incidente habría quedado en un experimento fallido y no en un escándalo global.&lt;br&gt;
Si tu modelo tiene salida pública, adopta estas capas desde el día uno. Es más fácil prevenir que tu chatbot se declare “MechaHitler” que reparar la reputación de la marca mañana.&lt;/p&gt;

</description>
    </item>
    <item>
      <title>Claudius</title>
      <dc:creator>Nicolas Boites</dc:creator>
      <pubDate>Thu, 10 Jul 2025 02:29:37 +0000</pubDate>
      <link>https://dev.to/nickboites/claudius-2cpl</link>
      <guid>https://dev.to/nickboites/claudius-2cpl</guid>
      <description>&lt;p&gt;Hace unos días Anthropic hizo un experimento real al permitir que Claudius, una IA, administrara por sí misma una máquina expendedora (“Project Vend”).&lt;/p&gt;

&lt;p&gt;Durante semanas, Claudius tomó decisiones autónomas: seleccionó proveedores, fijó precios, aceptó pagos e incluso respondió a clientes por su cuenta.&lt;/p&gt;

&lt;p&gt;Sin embargo, su desempeño mostró un problema importante: alucinaciones.&lt;/p&gt;

&lt;p&gt;Las “alucinaciones” son la tendencia de los modelos a generar contenido que parece verdadero o que parece tener sentido, pero que realmente es falso. Esto puede resultar especialmente riesgoso en entornos donde la precisión importa.&lt;/p&gt;

&lt;p&gt;En un momento, Claudius les pidió a los clientes que pagaran a una cuenta que no existía, una cuenta que él mismo se inventó.&lt;/p&gt;

&lt;p&gt;También empezó a realizar pedidos de cubos de tungsteno a sus proveedores solo porque los clientes se lo pidieron.&lt;/p&gt;

&lt;p&gt;Estos errores no solo son historias divertidas, sino que pueden ocurrir en contextos críticos.&lt;/p&gt;

&lt;p&gt;¿Qué podemos hacer en estos casos?&lt;/p&gt;

&lt;p&gt;Herramientas como Amazon Bedrock Guardrails nos permiten gestionar estos riesgos.&lt;/p&gt;

&lt;p&gt;Bedrock implementa varias capas de seguridad:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Contextual grounding checks: comparan las respuestas del modelo con fuentes confiables en RAG o conversaciones, detectando y bloqueando respuestas que no están fundamentadas ni son relevantes.&lt;/li&gt;
&lt;li&gt;Automated Reasoning Checks: validan la precisión lógica de las respuestas usando algoritmos matemáticos, ideales en sectores regulados, e incluso ofrecen explicaciones sobre por qué algo se considera correcto o no.&lt;/li&gt;
&lt;li&gt;Otras salvaguardas: bloqueo de temas sensibles, filtrado de contenido nocivo, anonimización de datos personales y prevención de ataques por manipulación de prompts.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Así, por ejemplo:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Si en un sistema RAG el modelo inventa un dato, Contextual Grounding lo detecta;&lt;/li&gt;
&lt;li&gt;Si el dato igual pasa filtros, Automated Reasoning verifica su lógica antes de divulgarlo.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Esto es vital en áreas como finanzas, medicina o legal, donde un error puede costar millones.&lt;/p&gt;

&lt;p&gt;Casos como el de Claudius son muy raros.&lt;/p&gt;

&lt;p&gt;Los modelos de lenguaje pueden cometer errores, sí. Sin embargo, hoy existen herramientas que permiten tener soluciones de IA seguras a través de:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Detectar respuestas no fundamentadas.&lt;/li&gt;
&lt;li&gt;Validar la coherencia lógica de esas respuestas.&lt;/li&gt;
&lt;li&gt;Bloquear o redirigir salidas inseguras antes de mostrarlas.&lt;/li&gt;
&lt;/ol&gt;




&lt;p&gt;PD.: Si quieres saber mas sobre el caso de Claudius, te dejo el link&lt;/p&gt;

&lt;p&gt;&lt;a href="https://www.anthropic.com/research/project-vend-1" rel="noopener noreferrer"&gt;https://www.anthropic.com/research/project-vend-1&lt;/a&gt;&lt;/p&gt;

</description>
    </item>
  </channel>
</rss>
