Volver al blog
Blog/IA y validación humana: cómo analizar el discurso en redes sociales sin fiarse a ciegas del modelo
2 min de lectura

28 de septiembre de 2026

IA y validación humana: cómo analizar el discurso en redes sociales sin fiarse a ciegas del modelo

Un estudio clasifica 403 titulares con un modelo de lenguaje y comprueba el resultado contra revisores humanos. El orden en que lo hace es la lección.

Clasificar miles de mensajes con un modelo de lenguaje es fácil y barato. Saber si lo ha hecho bien es otra historia. Un estudio publicado como preprint el 23 de septiembre por el investigador independiente Shahan Ahmed es un buen ejemplo, pequeño y reproducible, de cómo responder a esa segunda pregunta.

Qué hace

Analiza cómo siete medios de Bangladés en lengua inglesa titularon el brote de sarampión de 2026 en el país. Reúne 403 titulares y pide a un modelo de lenguaje que clasifique cada uno en dos dimensiones: el sentimiento y la postura, esta última con cuatro categorías cerradas.

Después compara lo que dice el modelo con lo que dicen revisores humanos en 153 titulares. El acuerdo se mide con el coeficiente kappa de Cohen, que va de 0 (el acuerdo que saldría por azar) a 1 (acuerdo total):

  • Postura: 0,89.
  • Sentimiento: 0,75.

Qué encuentra

Los titulares negativos pasaron del 56 % al 88 % a medida que avanzaba el brote, y los que amplificaban el riesgo, del 44 % al 84 %. La culpa, en cambio, apareció poco, en torno al 9 % de los titulares. Y en el 86 % de esos casos se atribuía a fallos del sistema, no a responsables políticos concretos.

El detalle que nos interesa

Los titulares de prensa no son redes sociales, pero el método es el que hace falta para analizar el discurso en TikTok o en Instagram. Y hay un dato que merece atención: las personas y el modelo coinciden más en la postura (0,89) que en el sentimiento (0,75). El sentimiento es más ambiguo de lo que parece. Por eso un porcentaje de «sentimiento positivo» sin validación detrás merece poca confianza.

Cómo lo leemos en Trendia

El orden importa:

  1. Categorías cerradas, definidas antes de clasificar.
  2. Una muestra anotada a mano por personas.
  3. Medir el acuerdo entre las personas y el modelo.
  4. Solo entonces, aplicar la IA al conjunto.

Es el criterio con el que trabajamos. En el proyecto con la UOC sobre salud mental en TikTok hubo una taxonomía de 15 etiquetas, 350 vídeos anotados a mano como referencia y, después, la clasificación de la muestra completa, más de 2.200 vídeos.

La IA permite llegar a miles de piezas. La validación humana es lo que permite fiarse del resultado.

Puedes ver el proyecto con la UOC o cómo trabajamos con equipos de investigación.

Fuente: Threat Amplified, Blame Restrained: LLM-Assisted Media Framing Analysis of the 2026 Bangladesh Measles Outbreak, arXiv, 23 de septiembre de 2026.