1. médialab Sciences Po
  2. Productions
  3. Reproductibilité ne signifie pas validité de construit : l’usage des LLM pour mesurer des communications inscrites dans des contextes institutionnels

Reproductibilité ne signifie pas validité de construit : l’usage des LLM pour mesurer des communications inscrites dans des contextes institutionnels

Veronika Batzdorfer, Carlo Romano Marcello Alessandro Santagiustina

Une forte reproductibilité des annotations n’implique pas nécessairement qu’une mesure inférée par un LLM saisisse effectivement le construit qu’elle est censée mesurer. Nous testons cette distinction à partir d’un jeu de données issu de la consultation de la Commission européenne sur l’AI Act, qui permet de mettre en correspondance les réponses à un questionnaire structuré avec les contributions en texte libre soumises par les mêmes parties prenantes. Les annotations par LLM des contributions à la consultation présentent une très forte reproductibilité (corrélations intraclasse > 0,99), mais ne convergent que faiblement avec les mesures déclarées dans le questionnaire pour le construit nominal qu’elles étaient censées approximer. L’écart entre les mesures issues du questionnaire et celles inférées par LLM à partir des textes varie systématiquement selon les catégories de parties prenantes : les associations d’entreprises expriment, dans leurs contributions textuelles publiques, des préoccupations plus fortes concernant les risques liés à l’IA que dans leurs réponses au questionnaire (ḡ = +1,0), tandis que les autorités publiques et plusieurs groupes non issus du monde des affaires présentent des écarts plus faibles, voire négatifs. Les écarts entre les scores suggèrent également une autocorrélation spatiale positive entre pays européens (I de Moran = 0,347, p = 0,036), indiquant que les parties prenantes issues de pays voisins tendent à adopter des positions publiques plus similaires concernant les enjeux de sécurité liés à l’IA. Malgré ces divergences, les préoccupations déclarées dans le questionnaire restent fortement associées au soutien à l’explicabilité, quel que soit le niveau de divergence entre les deux mesures. Ces résultats montrent qu’une forte reproductibilité des annotations par LLM peut coexister avec une faible correspondance avec le construit visé. Ils plaident ainsi pour des procédures de validation distinguant explicitement reproductibilité, validité de construit et variations liées au contexte de communication lorsque les LLM sont utilisés comme instruments de mesure.