Siete minutos con un chatbot superan a una hoja de datos en la reducción de teorías conspirativas

Una breve conversación con un modelo de lenguaje puede reducir las creencias conspirativas inmediatamente después de una crisis, incluso cuando la evidencia sólida es escasa. Según los investigadores, este efecto se mantiene ante nuevos eventos semanas después.

Dentro de la semana posterior al intento de asesinato de Donald Trump en julio de 2024, aproximadamente la mitad de una muestra representativa de EE. UU. había escuchado que el evento fue orquestado. El 11% lo creía. Tras el asesinato del activista de extrema derecha Charlie Kirk en septiembre de 2025, teorías sobre la participación del Mossad, una operación de "bandera falsa" y encubrimientos gubernamentales se propagaron en días. Un nuevo estudio de investigadores de Carnegie Mellon, MIT y Cornell probó si conversaciones breves con un modelo de lenguaje grande podían debilitar esas narrativas durante esa ventana exacta. Para ambos eventos, la respuesta fue afirmativa y el efecto se extendió más allá del evento en sí.

Dos experimentos en línea tras cada ataque

Los investigadores reclutaron adultos estadounidenses a través de una plataforma de encuestas y utilizaron GPT-4o, que ahora tiene más de dos años, para filtrar a los participantes que expresaron creencias conspirativas sobre el evento. El experimento de Trump mantuvo a 472 participantes, mientras que el de Kirk contó con 1.035.

Tras medir las creencias iniciales, los participantes fueron asignados aleatoriamente a una de tres condiciones. Un grupo tuvo al menos cinco rondas de intercambio con Google Gemini (versión 1.5 de febrero de 2024 en el primer experimento, versión 2.5 de junio de 2025 en el segundo), con instrucciones al modelo para reducir las creencias conspirativas mediante conversaciones basadas en evidencia. Un segundo grupo recibió una hoja de hechos estática con citas de fuentes. El tercero tuvo un chat de control irrelevante sobre si los gatos o los perros son mejores compañeros.

Ambos eventos ocurrieron después del corte de entrenamiento de los modelos utilizados, por lo que ninguno podía recurrir a conocimientos internos. Los investigadores construyeron una base de hechos curada directamente en el sistema prompt, dividida en hechos confirmados, afirmaciones ya desmentidas y preguntas marcadas explícitamente como abiertas. En el experimento de Kirk, también se permitió la búsqueda web, pero solo para verificar afirmaciones fácticas.

El diálogo superó a la hoja de hechos estática

Las conversaciones duraron en promedio unos siete minutos y redujeron la creencia en la propia teoría conspirativa del participante en ambos experimentos, tanto frente a la condición de control como frente a la hoja de hechos. El acuerdo con declaraciones sobre un "encubrimiento o conspiración" y "factores ocultos o no revelados" también disminuyó.

Gráfico comparativo de reducción de creencias tras interacción con LLM
Gráfico comparativo de reducción de creencias tras interacción con LLM

En ambos experimentos, la creencia en la teoría conspirativa del participante disminuyó más después del diálogo con el LLM que tras leer una hoja de datos estática. La confianza en la explicación oficial no aumentó en el experimento de Trump. Los autores creen que esto se debe a que no existía una explicación oficial clara en ese momento. Todo lo que se sabía era que la seguridad había fallado, y el motivo del tirador seguía siendo poco claro incluso cuando se redactó el estudio.

En el experimento de Kirk, donde las autoridades ya habían compartido detalles sobre el perpetrador, la confianza en la explicación oficial aumentó ligeramente en comparación con el chat de control. La diferencia frente a la hoja de hechos no fue significativa. El diálogo sobre Kirk tampoco tuvo un efecto medible en el apoyo a la violencia política.

El modelo adaptó tácticas según la información disponible

Para determinar cómo el modelo persuadió a las personas, los investigadores desglosaron sus respuestas en oraciones individuales. El modelo claramente se adaptó a la evidencia disponible.

Análisis de tácticas persuasivas del modelo según el evento
Análisis de tácticas persuasivas del modelo según el evento

Para el intento de asesinato de Trump, donde casi no se sabía nada sobre el motivo o los antecedentes del tirador, el modelo utilizó la persuasión racional con menos frecuencia que con teorías conspirativas clásicas. En su lugar, reconoció los límites de su propio conocimiento, instó a la cautela sobre sacar conclusiones precipitadas, formuló preguntas socráticas destinadas a hacer que los usuarios pensaran sobre su propia evidencia y señaló fuentes creíbles. Para el asesinato de Kirk, donde había más información disponible, el enfoque se pareció más al utilizado con conspiraciones clásicas, enfatizando los daños sociales del pensamiento conspirativo.

Desmentir un evento inoculó contra el siguiente

La conversación de desmentido se trasladó a eventos posteriores. Dos meses después del primer intento de asesinato de Trump, otro hombre armado fue arrestado en la propiedad del exmandatario. Los participantes que habían pasado por el diálogo de desmentido tenían menos probabilidades de creer que solo unas pocas personas poderosas conocerían la verdad o que esta se ocultaría al público.

Efecto de persistencia del desmentido en eventos posteriores
Efecto de persistencia del desmentido en eventos posteriores

El efecto persistió con el tiempo. Los participantes del grupo de desmentido calificaron eventos posteriores como menos propensos a involucrar un encubrimiento, aunque la diferencia no se mantuvo para el tiroteo en Grand Blanc Township. Dos semanas y media después del asesinato de Kirk, un tiroteo y ataque incendiario afectaron a una iglesia de Jesucristo de los Santos de los Últimos Días en Grand Blanc Township, Michigan. Los investigadores encuestaron a sus participantes nuevamente once días después. El análisis principal no encontró un efecto directo significativo para este evento.

Un análisis secundario sugirió que parte del efecto original todavía era visible en las narrativas conspirativas sobre el ataque a la iglesia. La transferencia apareció más claramente en las creencias conspirativas generales, con personas que habían hablado con el modelo menos propensas a estar de acuerdo con narrativas conspirativas comunes. En efecto, la intervención funcionó como una especie de prebunking contra futuras afirmaciones falsas. A diferencia de los métodos estándar de prebunking, donde las personas son advertidas con antelación y expuestas a una versión debilitada de la desinformación, este efecto ocurrió sin preparación previa.

Hacer que la gente hable con un LLM sigue siendo difícil

Los autores enfatizan que su trabajo es un estudio de caso. Puede haber crisis donde el enfoque falle, y casos donde exista una conspiración real y desmentirla sea incorrecto. También señalan su propio trabajo anterior que muestra que diálogos similares pueden funcionar a la inversa, convenciendo a las personas de narrativas conspirativas. Para conspiraciones emergentes, los autores marcan esto como un riesgo potencial de abuso.

Por supuesto, las personas deben estar dispuestas a hablar con un modelo de lenguaje sobre sus creencias en primer lugar. Pero cuando lo hacen, incluso conversaciones breves pueden marcar una diferencia medible, incluso cuando hay poca contraevidencia con la que trabajar. El mismo equipo redujo la creencia en teorías conspirativas establecidas en aproximadamente 20 puntos porcentuales a través de conversaciones con GPT-4 hace dos años, con efectos medibles incluso dos meses después. Lo novedoso aquí es la prueba en eventos recientes donde los hechos eran escasos. La razón por la que la conversación supera a una hoja de hechos fue objeto de un estudio con casi 77.000 participantes. Los modelos de lenguaje en diálogo fueron entre un 41 y un 52 por ciento más persuasivos que un mensaje de texto corto, y el factor decisivo fue el volumen de afirmaciones con fuentes, no tácticas conversacionales sofisticadas. El mismo mecanismo puede volverse contra las personas, como mostró un experimento no autorizado de la Universidad de Zúrich en Reddit.

Vía The Decoder.