Instruments de questionnaire validés pour les études d'annotation : personnalité, affect, bien-être et démographie
Quand l'identité de l'annotateur compte, un questionnaire validé vaut mieux qu'une question improvisée. Tour d'horizon des 55 instruments intégrés à Potato et du moment où chacun a sa place dans votre étude.
Une fois admis que les personnes qui annotent façonnent les étiquettes, la question suivante est : que mesurer à leur sujet ? L'âge et le niveau d'études sont un début évident, mais sur les tâches subjectives les prédicteurs intéressants sont souvent ailleurs : personnalité, valeurs, humeur du jour, expérience vécue de ce qui est jugé. La tentation est d'écrire vite quelques questions et de passer à autre chose. C'est en général une erreur, car une question que vous inventez n'a aucun antécédent, aucun groupe de comparaison, et souvent un défaut de formulation subtil que vous ne verrez qu'au moment de l'analyse.
Quand vous voulez mesurer quelque chose au sujet de vos annotateurs, prenez un instrument de questionnaire validé avant d'écrire le vôtre. Des instruments comme le Big Five, le PANAS ou une batterie démographique standard viennent avec des formulations éprouvées, une fidélité connue et des résultats comparables à un vaste corpus de travaux antérieurs, ce qu'aucune question improvisée ne vous donne. Potato en livre 55, utilisables dans une phase préalable ou postérieure avec une seule ligne de configuration. Ne recueillez que ce que vous analyserez, traitez les questionnaires de santé mentale comme des données sensibles, et obtenez le consentement.
Pourquoi ne pas simplement rédiger ses propres questions
Un instrument validé est un questionnaire dont des chercheurs ont éprouvé la fidélité (donne-t-il des résultats constants ?) et la validité (mesure-t-il ce qu'il prétend ?), en général sur de grands échantillons et de nombreuses études. En emprunter un vous achète trois choses qu'une question maison ne donne pas : des formulations vérifiées quant à l'ambiguïté et au biais, une méthode de scoring avec des normes publiées, et la comparabilité, puisque vos chiffres s'alignent sur ceux de tous les autres utilisateurs du même instrument.
Le coût du fait maison se manifeste plus tard. Une question de genre aux mauvaises modalités, une échelle de satisfaction subtilement orientée, une question de personnalité que la moitié de vos annotateurs lit autrement : chacune ajoute du bruit ou du biais que vous ne pourrez pas séparer du signal. Les auteurs de l'instrument ont déjà payé ce coût pour que vous n'ayez pas à le faire.
Ce que vous pourriez mesurer, et pourquoi cela ressort dans les étiquettes
Tout n'a pas sa place dans toutes les études. Accordez l'instrument à un effet plausible sur votre tâche.
- Démographie : qui annote. Les batteries démographiques (ANES, GSS, ACS et d'autres) captent l'âge, l'origine, le niveau d'études et le reste avec des formulations standardisées. Sur l'offense, la toxicité et la politesse, ce sont les prédicteurs les mieux étayés.
- Personnalité et valeurs : comment on juge. Le Big Five (Soto et John, 2017) et son cousin ultra-bref, le Ten-Item Personality Inventory (Gosling et al., 2003), captent des dispositions stables susceptibles de façonner les notations subjectives. Le Moral Foundations Questionnaire (Graham et al., 2011) s'impose naturellement quand les étiquettes sont des jugements moraux, puisqu'il mesure les intuitions morales qui les guident.
- Affect : l'humeur au moment d'étiqueter. Le PANAS (Watson et al., 1988) mesure l'affect positif et négatif. Passez-le en phase postérieure et vous pourrez vérifier si l'humeur a suivi les notes, ce qui importe pour du contenu émotionnellement chargé.
- Expérience vécue : la légitimité à juger. L'Everyday Discrimination Scale (Williams et al., 1997) mesure l'expérience quotidienne de la discrimination. Pour des tâches portant sur l'offense ou la haine visant un groupe, le fait qu'un annotateur l'ait vécue est plausiblement pertinent pour sa lecture.
- Bien-être : protéger l'annotateur. Des questionnaires de repérage comme le PHQ-9 (Kroenke et al., 2001) et le GAD-7 ne portent pas du tout sur les étiquettes. Sur des projets à contenu nocif ou éprouvant, un contrôle de bien-être léger aide à repérer la tension, à condition de traiter les réponses avec le soin qu'elles exigent.
La bibliothèque de 55 instruments, regroupée par catégorie, avec ceux qui intéressent l'annotation mis en évidence
Sensibilité, charge et consentement
Mesurer vos annotateurs n'est pas sans risque, et deux de ces catégories pèsent lourd.
Les questionnaires de santé mentale sont des données personnelles sensibles. Un score PHQ-9 n'est pas un diagnostic ; il ne doit jamais être traité comme tel ni servir à écarter quelqu'un du travail. Si vous en passez un, dites pourquoi, gardez-le facultatif, stockez-le séparément de tout élément identifiant, et sachez d'avance ce qu'un score préoccupant signifiera avant de le recueillir. Dans le doute, c'est une conversation à avoir avec un comité d'éthique.
La longueur est un impôt en soi. Le Big Five Inventory-2 compte 60 items ; un empilement complet de batteries peut prendre plus de temps que l'annotation. Chaque question supplémentaire coûte en taux de complétion et en attention : appuyez-vous sur les formes courtes (le TIPI en 10 items, le PHQ-2 en 2 items) sauf si la version longue vous est vraiment nécessaire, et coupez tout ce que vous n'analyserez pas. Comme pour la démographie, la règle tient : s'il n'y a aucune comparaison prévue avec, cela ne va pas dans le formulaire.
Le faire dans Potato
Potato inclut une bibliothèque de 55 instruments validés couvrant la personnalité, la santé mentale, l'affect, les attitudes sociales et politiques, et huit batteries démographiques, tous documentés dans Instruments de questionnaire. Vous ne construisez pas ces questionnaires ; vous les nommez.
Référencez un instrument par son identifiant dans une phase préalable ou postérieure :
phases:
order: [consent, prestudy, annotation, poststudy]
prestudy:
type: prestudy
instrument: "tipi" # 10-item Big Five
poststudy:
type: poststudy
instrument: "panas" # affect, measured after the taskEmpilez-en plusieurs avec instruments:, et ajoutez vos propres questions propres à l'étude après une batterie :
phases:
prestudy:
type: prestudy
instruments:
- "gss-demographics" # standardized demographics
- "srh" # single self-rated health item
file: "surveys/study_specific.json" # appended after the instrumentsChaque instrument porte ses métadonnées de scoring (méthode, items inversés, étendue, seuils), même si Potato laisse le calcul du score à votre analyse plutôt que de le faire à votre place, ce qui est le bon choix pour tout ce qui est clinique. La démonstration démographie-avec-consentement assemble tout le flux : une porte de consentement, une batterie démographique standardisée en phase préalable, et une tâche de notation subjective, si bien que le profil de l'annotateur atterrit à côté des étiquettes, là où vous pouvez l'analyser.
Où aller ensuite
- Recueillir les données démographiques des annotateurs de façon responsable, pour les batteries démographiques bien faites.
- Le désaccord est un signal, pas du bruit, pour comprendre pourquoi la variation de personnalité et de valeurs dans les étiquettes est souvent ce que vous voulez.
- Documenter votre jeu de données d'annotation, pour rapporter ce que vous avez mesuré de vos annotateurs.
- Instruments de questionnaire, la liste complète des 55, avec identifiants et nombre d'items.