DEV Community

Cover image for Agentes de IA se pliegan a la opinión mayoritaria, halla un estudio
lu1tr0n
lu1tr0n

Posted on Originally published at elsolitario.org

Agentes de IA se pliegan a la opinión mayoritaria, halla un estudio

Cuando tres agentes de inteligencia artificial debaten una respuesta y dos coinciden, el tercero suele abandonar su postura inicial, aunque nadie se lo haya pedido. Un estudio reportado por PsyPost describe este comportamiento como conformidad en agentes de IA: la tendencia de un modelo de lenguaje a alinearse con la opinión mayoritaria de un grupo de agentes, incluso cuando esa opinión no es la más precisa.

El hallazgo importa porque buena parte de los sistemas de IA modernos ya no usan un solo modelo: encadenan varios agentes que debaten, revisan y votan antes de dar una respuesta final. Si esos agentes heredan el mismo sesgo social que documentó la psicología hace décadas, el resultado puede ser menos preciso, no más.

TL;DR

  • Un estudio reportado por PsyPost describe conformidad espontánea en agentes de IA dentro de debates multiagente.
  • Los agentes en minoría alinean su respuesta con la mayoría del grupo, aunque nadie se lo pida de forma explícita.
  • El patrón recuerda a los experimentos de conformidad de Solomon Asch, de la década de 1950, en psicología social.
  • El diseño de 'debate entre múltiples agentes' del MIT ya usaba el intercambio de respuestas entre modelos para mejorar precisión.
  • El riesgo es que si la mayoría inicial se equivoca, la conformidad amplifica el error en vez de corregirlo.
  • La alternativa técnica es la agregación por voto independiente o ponderado, sin exposición cruzada previa entre agentes.
  • El hallazgo afecta a frameworks de agentes que ya encadenan varios modelos en producción, como AutoGen o CrewAI.

Qué pasó

La nota de PsyPost, replicada por MSN, describe cómo los agentes de inteligencia artificial ceden ante la opinión mayoritaria cuando interactúan entre sí en un entorno de debate. El diseño es simple: varios agentes reciben la misma pregunta, cada uno responde por su cuenta y después se les muestra lo que respondieron los demás antes de dar una respuesta final. En ese segundo turno, los agentes que quedaron en minoría cambian su respuesta hacia la de la mayoría con más frecuencia que al revés.

Este diseño experimental no es nuevo: es la misma lógica que Solomon Asch usó con personas en 1951, solo que aquí los participantes son modelos de lenguaje. La diferencia es que los agentes de IA no tienen ego ni miedo al rechazo social, dos explicaciones clásicas de por qué los humanos se pliegan al grupo. Aun así, el patrón aparece.

El fenómeno no depende de que un agente sepa de forma explícita que está en minoría. Basta con que el prompt de la segunda ronda incluya el texto de las respuestas ajenas para que el modelo ajuste su propia salida, igual que ajusta el tono o el formato cuando ve ejemplos previos en el contexto. Es, en el fondo, una consecuencia directa de cómo funciona el aprendizaje en contexto: el modelo trata las respuestas de otros agentes como parte del patrón a seguir, no como opiniones externas que hay que sopesar de forma crítica.

Contexto e historia de la conformidad en agentes de IA

El experimento de Asch de 1951 sentó las bases de la conformidad social: pidió a un grupo de personas que compararan la longitud de líneas y sembró cómplices que daban a propósito una respuesta obviamente incorrecta. Buena parte de los participantes reales terminaba repitiendo, al menos en algún momento de la serie de pruebas, la respuesta equivocada del grupo, según documenta la entrada de Wikipedia sobre los experimentos de conformidad de Asch. Décadas después, la misma dinámica social aparece en sistemas que no tienen ni ego ni memoria emocional.

La investigación en sistemas multiagente de IA no partió buscando sesgos de conformidad, partió buscando mejorar la precisión. En 2023, un equipo vinculado al MIT publicó un método de debate entre múltiples agentes de lenguaje para mejorar el razonamiento y la factualidad de sus respuestas, donde varios agentes ven las respuestas de los demás y las revisan en rondas sucesivas. La idea funciona cuando el error es aleatorio, porque el grupo converge hacia la respuesta correcta. El problema aparece cuando el error es sistemático: ahí el debate no corrige, amplifica.

💭 Clave: el mismo mecanismo que hace que el debate entre agentes mejore la precisión ante errores aleatorios es el que amplifica el error cuando la mayoría inicial se equivoca de forma sistemática.

El diseño de debate multiagente expone a cada modelo a las respuestas de los demás antes de la ronda final.

Detalles técnicos y rendimiento

Un sistema de debate multiagente típico tiene tres partes: la ronda de respuesta independiente, el intercambio de respuestas entre agentes y la ronda de revisión. En la primera ronda cada agente responde sin ver nada más que la pregunta original. En la segunda, cada agente recibe como contexto adicional las respuestas del resto del grupo. En la tercera, cada agente puede mantener o cambiar su respuesta a la luz de lo que vio.

Ese segundo paso, el intercambio de respuestas, es exactamente donde entra la presión social. Un agente que respondió distinto al resto no solo ve que está en minoría: ve la respuesta de la mayoría redactada con la misma seguridad y el mismo tono confiado que la suya. Los modelos de lenguaje no tienen forma nativa de distinguir 'consenso porque es correcto' de 'consenso porque el prompt sembró el mismo sesgo en todos los agentes', así que tienden a resolver la ambigüedad a favor del grupo.

Método de agregaciónCómo funcionaVentajaLimitaciónVoto independienteCada agente responde sin ver a los demás; se agregan las respuestas por mayoría al finalNo hay exposición cruzada, así que no hay conformidad posiblePierde la oportunidad de que el debate corrija un error individualDebate secuencialLos agentes ven las respuestas previas del grupo y pueden revisar la propia en rondas sucesivasMejora la precisión colectiva cuando el error de un agente es aleatorioAmplifica el sesgo de conformidad cuando el error de la mayoría es sistemáticoAgregación ponderadaSe pondera cada voto según la confianza declarada o el historial de acierto de cada agenteReduce el peso de una mayoría equivocada si su confianza es bajaRequiere calibrar la confianza, algo que los modelos de lenguaje suelen sobreestimar

Cómo probarlo

Reproducir el efecto no requiere un laboratorio de psicología, alcanza con una API de modelos de lenguaje y unas quince líneas de Python. La idea es lanzar el mismo prompt contra varias instancias del mismo modelo, guardar la primera respuesta de cada una, y después mostrarle a cada agente las respuestas del resto antes de pedirle una respuesta final.

import anthropic

client = anthropic.Anthropic()

pregunta = "¿Cuál es la capital administrativa de Sudáfrica?"

def responder(agente_id, contexto_extra=""):
    mensaje = client.messages.create(
        model="claude-sonnet-5",
        max_tokens=200,
        messages=[{
            "role": "user",
            "content": f"{pregunta}\n{contexto_extra}"
        }]
    )
    return mensaje.content[0].text

respuesta_agente_1 = responder("agente_1")
print(respuesta_agente_1)
Enter fullscreen mode Exit fullscreen mode

Este primer bloque solo dispara una respuesta independiente por agente: todavía no hay intercambio de opiniones entre ellos.

respuestas_ronda_1 = {}
for agente_id in ["agente_1", "agente_2", "agente_3"]:
    respuestas_ronda_1[agente_id] = responder(agente_id)

def construir_contexto(agente_id, respuestas):
    otras = [r for aid, r in respuestas.items() if aid != agente_id]
    return "Otros agentes respondieron: " + " | ".join(otras) + \
        "\nRevisa tu respuesta anterior si corresponde."

respuestas_ronda_2 = {}
for agente_id in respuestas_ronda_1:
    contexto = construir_contexto(agente_id, respuestas_ronda_1)
    respuestas_ronda_2[agente_id] = responder(agente_id, contexto)

cambios_hacia_mayoria = sum(
    1 for aid in respuestas_ronda_1
    if respuestas_ronda_1[aid] != respuestas_ronda_2[aid]
)
print(f"Agentes que cambiaron de respuesta: {cambios_hacia_mayoria}")
Enter fullscreen mode Exit fullscreen mode

Este segundo bloque expone a cada agente a las respuestas del resto antes de la ronda final y cuenta cuántos cambiaron de postura. La métrica que hay que observar para confirmar el efecto es esa tasa de cambio, comparada entre correr el experimento con exposición cruzada y correr el mismo experimento sin ella, solo con voto independiente.

sequenceDiagram
participant A1 as Agente 1
participant A2 as Agente 2
participant A3 as Agente 3
A1->>A2: comparte respuesta X
A1->>A3: comparte respuesta X
A2->>A1: comparte respuesta X
A2->>A3: comparte respuesta X
A3->>A1: comparte respuesta Y
A3->>A2: comparte respuesta Y
Note over A3: ve que A1 y A2 coinciden en X
A3-->>A1: revisa su respuesta hacia X
A3-->>A2: revisa su respuesta hacia X
Enter fullscreen mode Exit fullscreen mode

⚠️ Ojo: una tasa alta de cambio de respuesta no es lo mismo que alucinación. La alucinación es un error de contenido; la conformidad es un cambio de respuesta motivado por la presión social del grupo, incluso cuando la respuesta original era correcta.

El agente en minoría revisa su respuesta tras ver que los otros dos coinciden.

Impacto y análisis

El efecto no se queda en el laboratorio. Los frameworks de agentes que ya operan en producción, encadenando varios modelos para revisar código, resumir documentos o tomar decisiones, suelen incluir algún paso de intercambio de opiniones entre agentes, explícito o implícito en el prompt. Si ese paso hereda el sesgo de conformidad, el sistema puede volverse menos confiable cuantos más agentes se le agregan, justo lo contrario de lo que promete el diseño multiagente.

El caso más delicado es cuando se usa un comité de agentes como verificador de calidad, por ejemplo para revisar si una respuesta contiene información falsa. Si el primer agente en responder se equivoca con seguridad, y el resto ve esa respuesta antes de emitir la propia, el consenso final puede terminar validando el error original en lugar de detectarlo.

Frameworks de orquestación de agentes como AutoGen, CrewAI o LangGraph ya ofrecen patrones de 'varios agentes revisan el trabajo de otros' como forma de mejorar la calidad de una respuesta final. Ninguno audita por defecto si la mejora observada viene de una corrección genuina o de que los agentes simplemente convergieron entre sí. Esa auditoría queda, hoy, en manos de quien construye el sistema.

Para equipos que despliegan asistentes basados en varios modelos (por ejemplo, un agente que escribe código y otro que lo revisa, o un comité que verifica una respuesta antes de mostrarla al usuario final) la lectura práctica es simple: agregar más agentes no garantiza más objetividad. Si todos comparten el mismo sesgo de entrenamiento y ven las respuestas de los demás antes de opinar, el comité puede converger rápido y converger mal.

Qué sigue

Los equipos que construyen frameworks de agentes ya conocen mitigaciones parciales: recolectar todas las respuestas independientes antes de mostrar nada (voto ciego), pedir a cada agente que justifique su respuesta en lugar de solo declararla, o rotar el orden en que se muestran las respuestas para que ningún agente vea siempre la misma mayoría primero. Ninguna de estas soluciones elimina el sesgo por completo: lo que hacen es moverlo de una arquitectura ciega a una arquitectura donde al menos se puede medir.

Una alternativa ya explorada en la literatura de razonamiento de modelos de lenguaje es la autoconsistencia: generar varias respuestas independientes del mismo modelo con distintas semillas aleatorias, sin exposición cruzada, y quedarse con la más frecuente. Es, en esencia, la versión de 'voto independiente' de la tabla anterior, aplicada a un solo modelo en lugar de a varios agentes distintos.

📖 Resumen en Telegram: Ver resumen

Probá el experimento vos mismo: corré el mismo prompt contra tres instancias de un modelo con y sin exposición cruzada entre rondas, y compará cuántas respuestas cambian de bando.

Preguntas frecuentes

¿Qué significa que un agente de IA "se conforme" a la mayoría?

Significa que, al ver las respuestas de otros agentes antes de dar la suya, un modelo de lenguaje cambia su respuesta hacia la que da el resto del grupo, incluso sin que se le pida explícitamente coincidir con nadie.

¿Ocurre en todos los modelos de lenguaje?

El diseño experimental (ronda independiente, exposición cruzada, ronda final) se puede reproducir con cualquier modelo que acepte texto como contexto adicional. La magnitud del efecto depende del modelo y del prompt, y se mide comparando la tasa de cambio de respuesta con y sin exposición cruzada.

¿Es lo mismo que la alucinación?

No. La alucinación es un modelo inventando información falsa por su cuenta. La conformidad es un cambio de respuesta motivado por ver la opinión de otros agentes, incluso cuando la respuesta original era correcta.

¿Cómo se puede reducir el efecto?

Recolectando todas las respuestas de forma independiente antes de mostrar nada, pidiendo justificación explícita en vez de solo la respuesta final, o ponderando cada voto según el historial de acierto del agente en vez de tratarlos como iguales.

¿Qué relación tiene esto con los experimentos de Asch?

El diseño es prácticamente el mismo que usó Solomon Asch en 1951 con personas: comparar una respuesta individual antes y después de ver la opinión de un grupo. La diferencia es que aquí el grupo son otros modelos de lenguaje.

¿Dónde puedo revisar el estudio y la investigación relacionada?

La cobertura original está en PsyPost, replicada por MSN, y el diseño de debate multiagente que la precede está documentado en el paper vinculado al MIT sobre razonamiento multiagente, ambos enlazados en la sección de referencias.

Referencias

📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.

Top comments (0)