
28 de setembre del 2026
IA i validació humana: com analitzar el discurs a les xarxes socials sense refiar-se a cegues del model
Un estudi classifica 403 titulars amb un model de llenguatge i comprova el resultat contra revisors humans. L'ordre en què ho fa és la lliçó.
Classificar milers de missatges amb un model de llenguatge és fàcil i barat. Saber si ho ha fet bé ja és una altra història. Un estudi publicat com a preprint el 23 de setembre per l'investigador independent Shahan Ahmed és un bon exemple, petit i reproduïble, de com respondre aquesta segona pregunta.
Què fa
Analitza com set mitjans de Bangladesh en llengua anglesa van titular el brot de xarampió del 2026 al país. Reuneix 403 titulars i demana a un model de llenguatge que classifiqui cadascun en dues dimensions: el sentiment i el posicionament, aquest últim amb quatre categories tancades.
Després compara el que diu el model amb el que diuen revisors humans en 153 titulars. L'acord es mesura amb el coeficient kappa de Cohen, que va de 0 (l'acord que sortiria per atzar) a 1 (acord total):
- Posicionament: 0,89.
- Sentiment: 0,75.
Què hi troba
Els titulars negatius van passar del 56 % al 88 % a mesura que avançava el brot, i els que amplificaven el risc, del 44 % al 84 %. La culpa, en canvi, hi va aparèixer poc, al voltant del 9 % dels titulars. I en el 86 % d'aquests casos s'atribuïa a fallades del sistema, no a responsables polítics concrets.
El detall que ens interessa
Els titulars de premsa no són xarxes socials, però el mètode és el que cal per analitzar el discurs a TikTok o a Instagram. I hi ha una dada que mereix atenció: les persones i el model coincideixen més en el posicionament (0,89) que en el sentiment (0,75). El sentiment és més ambigu del que sembla. Per això un percentatge de «sentiment positiu» sense validació al darrere mereix poca confiança.
Com ho llegim a Trendia
L'ordre compta:
- Categories tancades, definides abans de classificar.
- Una mostra anotada a mà per persones.
- Mesurar l'acord entre les persones i el model.
- Només llavors, aplicar la IA al conjunt.
És el criteri amb què treballem. Al projecte amb la UOC sobre salut mental a TikTok hi va haver una taxonomia de 15 etiquetes, 350 vídeos anotats a mà com a referència i, després, la classificació de la mostra completa, més de 2.200 vídeos.
La IA permet arribar a milers de peces. La validació humana és el que permet refiar-se del resultat.
Pots veure el projecte amb la UOC o com treballem amb equips de recerca.
Font: Threat Amplified, Blame Restrained: LLM-Assisted Media Framing Analysis of the 2026 Bangladesh Measles Outbreak, arXiv, 23 de setembre de 2026.