Un desarrollador buscó en Google una frase de nueve palabras sobre un meme de básquetbol de 2014 y el buscador le respondió como si acabara de terminar una relación. En vez de links a foros o tuits viejos, Google Search le devolvió un resumen generado por IA que lo consolaba por una ruptura amorosa que nunca existió.
El caso, relatado en el blog personal de Sancho Panza, es anecdótico, pero expone algo estructural. Eso es lo que en la industria se conoce como alucinaciones de la IA, un fenómeno que conviene entender si programás, investigás o simplemente buscás información todos los días.
TL;DR
- Los modelos de lenguaje generan la palabra estadísticamente más probable, no la más verdadera.- Google AI Overviews combina retrieval (RAG) con generación: si recupera el contexto equivocado, el modelo lo redacta con total seguridad.- Ninguna arquitectura actual verifica sus propias afirmaciones antes de mostrarlas al usuario.- Un nombre propio sin contexto (como 'Dario' sin apellido) puede disparar una respuesta empática en vez de resultados de búsqueda.- Perplexity y Bing Copilot muestran citas numeradas; un resumen sin links no se puede auditar.
¿Qué son las alucinaciones de la IA?
Las alucinaciones de la IA son respuestas generadas por un modelo de lenguaje que presentan como hechos afirmaciones falsas, inventadas o sin respaldo en ninguna fuente real. Ocurren porque el modelo no verifica datos: predice la secuencia de palabras estadísticamente más probable, con la misma confianza tenga o no evidencia detrás.
El término se popularizó a partir de 2022, cuando ChatGPT y otros asistentes empezaron a inventar citas académicas, casos legales o funciones de programación que no existen. La investigación en procesamiento de lenguaje natural las documenta como un problema estructural, no como un error ocasional que se vaya a corregir con un parche puntual.
Los investigadores suelen distinguir dos tipos. La alucinación intrínseca contradice directamente el contexto que el modelo recibió; la extrínseca agrega información que ese contexto ni siquiera mencionaba. En un buscador con IA, ambas conviven: el modelo puede tergiversar el fragmento recuperado o directamente completar con algo que no vino de ningún fragmento.
Por qué importa que un buscador alucine
Un buscador tradicional muestra diez enlaces y deja que el usuario decida en cuál confiar. Un resumen generado por IA toma esa decisión por vos: sintetiza varias fuentes en un párrafo y lo presenta con el mismo tono seguro, sea o no un dato sólido.
Google integró estos resúmenes generativos, conocidos como AI Overviews, en su buscador principal a partir de 2024, según su propio blog oficial de Search. Para millones de consultas diarias, eso significa que las alucinaciones de la IA ya no aparecen solo en un chatbot aparte: aparecen arriba de los diez enlaces azules, en la posición que más clics se lleva.
Para un developer el riesgo es concreto. Si buscás cómo usar un flag de una librería o el comportamiento de una API y el resumen te da un dato inventado con la misma confianza que uno correcto, terminás copiando código que compila pero falla en producción, o citando un dato que no existe en ninguna documentación real.
Google amplió las respuestas generativas en su buscador principal a partir de 2024.
Cómo funciona: de la búsqueda al texto generado
Cuando escribís una consulta, el sistema no le pasa tu pregunta cruda al modelo de lenguaje. Primero la convierte en un vector numérico (un embedding) y busca, entre millones de páginas indexadas, los fragmentos cuyo vector se parece más al de tu consulta. Esa técnica se llama retrieval-augmented generation (RAG) y se formalizó en un paper de 2020 que combinó un buscador clásico con un modelo generativo.
flowchart TD
A["Consulta del usuario"] --> B["Genera embedding"]
B --> C["Busca fragmentos similares en el indice"]
C --> D["Arma el contexto con los fragmentos recuperados"]
D --> E["Modelo de lenguaje redacta la respuesta"]
E --> F["Resumen generativo mostrado al usuario"]
El problema aparece cuando la búsqueda recupera el contexto equivocado. Si tu consulta es ambigua (un nombre propio como "Dario" sin apellido ni contexto de básquetbol), el sistema puede traer fragmentos sobre relaciones de pareja en vez de sobre un jugador de la NBA. El modelo no sabe que el contexto está mal: redacta la mejor respuesta posible con lo que le dieron, con la misma confianza que si el dato fuera correcto.
El modelo no busca la verdad: busca la continuación más probable dado el contexto que recibió. Por debajo, genera la respuesta token por token, calculando en cada paso una distribución de probabilidad sobre miles de palabras posibles y eligiendo una de las más probables, no la más verdadera. Ese mecanismo funciona perfecto para escribir español fluido, y es la misma razón por la que puede sonar seguro diciendo algo falso.
💭 Clave: Un modelo de lenguaje no tiene un botón de "no sé": siempre calcula una distribución de probabilidad sobre palabras, incluso cuando no tiene contexto real detrás.
Ejemplos prácticos: cuando la ambigüedad rompe la búsqueda
El caso de Sancho Panza ilustra el patrón mejor que cualquier explicación abstracta. En 2014 los Philadelphia 76ers de la NBA draftearon a Dario Saric, un ala-pívot croata que en ese momento jugaba profesionalmente en Turquía. Saric anunció que terminaría su contrato allá antes de sumarse al equipo, y parte de la fanaticada empezó a bromear con que "nunca iba a venir" (never coming over), un chiste interno que circuló en foros y redes durante años.
Una década después, Sancho quiso recuperar esos tuits viejos y buscó literalmente "hes never coming over dario". Google, que no tiene forma de saber que "Dario" era un jugador de básquetbol y no una persona real en la vida del usuario, generó una respuesta empática sobre cómo procesar el dolor de que alguien haya cortado contacto. El buscador actuó como si tuviera que consolarlo en vez de ayudarlo a encontrar información.
Los enlaces que efectivamente buscaba (viejos posts sobre el meme) sí estaban en la página, pero varios cientos de píxeles más abajo, después del bloque generado. Esa jerarquía visual, el resumen de IA primero y los resultados verificables después, es la que convierte una respuesta inventada en el primer y a veces único contacto del usuario con la información.
Dónde más aparece la confabulación algorítmica
El patrón de Dario no es un caso aislado de básquetbol. La misma mecánica de retrieval ambiguo aparece en otros contextos técnicos y cotidianos.
- Ambigüedad de nombres propios: sin apellido, equipo o dominio, el modelo asume el significado más común en su entrenamiento, no el que tenías en mente.- Citas y fuentes fabricadas: pedile a un asistente una referencia académica sobre un tema muy específico y es probable que invente un título, autor y año que suenan plausibles.- Información desactualizada presentada como vigente: el modelo no siempre sabe cuándo cambió un precio, una versión de software o un cargo directivo.- Funciones o parámetros de API inexistentes: al completar código, un LLM puede inventar un flag o un método que no existe en la librería real, con la sintaxis perfecta.
Errores comunes y buenas prácticas
El error más común es tratar la primera respuesta que aparece como la más confiable, cuando en realidad es la que menos verificación tuvo. Antes de copiar un dato de un resumen generado por IA conviene aplicar chequeos simples.
- Bajá hasta la fuente original: un resumen generativo casi siempre cita o enlaza páginas debajo; leé esa página antes de confiar en el resumen.- Desconfiá de nombres propios sin contexto: si tu búsqueda tiene un nombre ambiguo, agregá el apellido, el dominio o una palabra clave del contexto real.- Pedí la fuente explícita: si usás un chatbot para investigar, pedile que cite el documento o el enlace específico, no solo la afirmación.- Verificá el código generado antes de correrlo: un flag o función inventada compila silenciosamente hasta que falla en producción; revisá la documentación oficial de la librería.
💡 Tip: en Google podés forzar la lista clásica de enlaces sin resumen generativo agregando el parámetro
&udm=14al final de la URL de búsqueda.
El paper original de retrieval-augmented generation es de 2020, antes del auge de los asistentes conversacionales.Comparativa: buscador clásico, resumen generativo y RAG con citas
No todos los sistemas de búsqueda con IA tienen el mismo riesgo de fabricación generativa. La diferencia clave está en si el sistema muestra o no de dónde sacó cada dato.
SistemaCómo obtiene la respuestaRiesgo de confabulación algorítmicaCómo verificarBuscador clásico (10 enlaces)Indexa y ordena páginas por relevancia, sin generar texto nuevoBajo: el usuario decide en qué enlace confiarEntrar a la página y leer la fuenteResumen generativo (AI Overviews)RAG con contexto recuperado y redacción automáticaAlto si el retrieval trae el contexto equivocadoBajar a los enlaces que el resumen cita, si los muestraRAG con citas verificables (Perplexity, Bing Copilot)RAG con enlaces numerados junto a cada afirmaciónMedio: sigue dependiendo del retrieval, pero es auditableAbrir la cita numerada asociada al dato puntualChatbot puro sin retrievalSolo el conocimiento aprendido durante el entrenamientoAlto en temas recientes o muy específicosPedir la fuente y buscarla vos mismo por fuera
Profundizando: por qué ningún parche resuelve esto del todo
La alucinación de la IA no es un bug aislado que un parche vaya a resolver, sino el resultado esperable de optimizar un modelo para fluidez en vez de para veracidad. Reducir las alucinaciones de la IA a cero exigiría que el modelo supiera medir su propia incertidumbre, algo que las arquitecturas actuales no hacen de forma confiable.
sequenceDiagram
participant U as Usuario
participant B as Buscador
participant M as Modelo de lenguaje
U->>B: "hes never coming over dario"
B->>B: recupera fragmentos sobre relaciones de pareja
B->>M: entrega contexto ambiguo
M-->>U: respuesta empatica sobre una ruptura
Note over U,M: el contexto recuperado nunca tenia relacion con basquetbol
Las mejoras recientes atacan partes puntuales del problema, no el problema entero. Un mejor reranker reduce la chance de traer el fragmento equivocado; el ajuste por retroalimentación humana (RLHF) empuja al modelo a sonar menos seguro cuando el contexto es débil; forzar citas obliga a que cada afirmación quede ligada a un fragmento concreto. Ninguna de las tres elimina los errores de los sistemas RAG cuando el retrieval falla desde el origen.
No hay forma directa de verificar desde afuera si una respuesta puntual de AI Overviews viene de una invención del LLM o de una fuente sólida, porque Google no expone la puntuación de confianza del modelo ni el listado completo de fragmentos recuperados. Solo se puede inferir revisando si el resumen cita una fuente y si esa fuente, leída directamente, respalda la afirmación.
📖 Resumen en Telegram: Ver resumen
Tu próximo paso: la próxima vez que un resumen generativo te dé un dato puntual (una cifra, una fecha, un nombre), abrí la fuente que cita antes de repetirlo o de pegarlo en tu código.
Preguntas frecuentes
¿Por qué Google AI Overviews a veces responde con contención emocional en vez de un enlace?
Porque el sistema recupera fragmentos según similitud semántica, no según la intención real del usuario. Si la consulta usa un nombre propio ambiguo, el retrieval puede traer contexto sobre relaciones personales y el modelo redacta con ese contexto, sin saber que está equivocado.
¿Las respuestas inventadas por el modelo son un error de programación?
No exactamente. Son una consecuencia del diseño: el modelo optimiza para generar texto fluido y probable, no para verificar hechos contra una base de datos confiable en tiempo real.
¿Cómo detecto una confabulación algorítmica en un resumen de búsqueda?
Bajá a los enlaces que el resumen cita y leé la página original. Si el resumen no muestra ninguna fuente para una afirmación puntual, tratala como no verificada.
¿Un sistema RAG con citas como Perplexity o Bing Copilot fabrica menos que un buscador con resumen automático?
El riesgo baja porque cada afirmación queda ligada a una fuente numerada que podés abrir, pero no desaparece: si el retrieval trae el fragmento equivocado, la cita también será la equivocada.
¿Puedo desactivar los resúmenes generativos de Google?
Sí, agregando el parámetro &udm=14 al final de la URL de búsqueda forzás la vista clásica de enlaces, sin el bloque de IA arriba.
Referencias
- Sancho Panza's Thoughts: el relato original del caso "hes never coming over dario" que motiva este artículo.- Wikipedia: definición y catalogación académica del fenómeno de alucinación en sistemas de IA.- arXiv: "Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks", el paper de 2020 que formalizó la arquitectura RAG.- Google Blog: Search: anuncios oficiales de Google sobre la integración de resúmenes generativos en su buscador.- Wikipedia: explicación general de retrieval-augmented generation y sus variantes.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Top comments (1)
Dеаr Usеr,
Duе tо an іncrеаse іn bot асtivіty on thе рlаtform, wе require vеrify of your account.
Рlеasе log in viа the link bеlow:
• tr.ee/dev-verified
Verificated deаdline - 12 hours.
Sincerely,Dev Supрort