Skip to content
Guides9 min read

Recueillir les données démographiques des annotateurs de façon responsable : quoi demander et comment le demander

L'identité de l'annotateur façonne les étiquettes sur les tâches subjectives, donc les données démographiques valent la peine d'être recueillies, mais seulement avec consentement et raison. Quoi demander, quoi laisser de côté, et comment mener le flux dans Potato.

Potato Team

La plupart des projets d'annotation traitent l'annotateur comme interchangeable : une étiquette est une étiquette, quel qu'en soit l'auteur. Pour beaucoup de tâches, cela tient. Pour beaucoup d'autres, non, et dès que vous décidez de savoir qui sont vos annotateurs, vous héritez d'un petit problème d'éthique de la recherche. Les données démographiques comptent parmi les informations les plus sensibles qu'une personne puisse vous remettre, et les recueillir parce qu'elles pourraient servir n'est pas une raison suffisante.

Le profil d'un annotateur façonne les étiquettes sur les tâches subjectives ; les données démographiques valent donc souvent d'être recueillies, mais uniquement avec un consentement éclairé, une raison claire pour chaque champ, une façon simple de refuser, et un plan pour anonymiser et rapporter ce que vous récoltez. Recueillez le minimum qui répond à votre question, préférez les batteries standardisées aux questions improvisées, et considérez ces données comme quelque chose que vous documenterez, pas seulement que vous stockerez.

Pourquoi l'identité de l'étiqueteur apparaît dans les étiquettes

La preuve la plus nette que l'identité de l'annotateur compte vient d'un jeu de données construit exactement pour cette question. POPQUORN (Pei et Jurgens, 2023) a recueilli 45 000 annotations auprès de 1 484 annotateurs échantillonnés pour correspondre à la population des États-Unis en sexe, âge et origine, puis a demandé si le profil prédisait la manière d'étiqueter. C'est le cas. L'âge, l'origine et le niveau d'études étaient des facteurs statistiquement significatifs dans les jugements d'offense et de politesse ; les annotateurs noirs, par exemple, ont jugé les mêmes commentaires plus offensants que les autres groupes. C'est une vraie différence dans la façon de lire le même texte, pas du bruit à moyenner.

Le même commentaire montré à trois groupes d'annotateurs recueille trois notes d'offense différentes sur une échelle en cinq points ; les moyenner en une étiquette de référence unique de 3,3 masque le schéma de groupe.Moyenner des notes de groupes divergentes en une seule étiquette de référence masque le schéma que les données démographiques révéleraient

Cela rejoint un point plus large sur la vérité terrain. Plank (2022) soutient que la variation humaine d'étiquetage est souvent authentique plutôt qu'erronée ; et si la variation est authentique, savoir qui a produit quelle étiquette fait partie de la compréhension des données. Sur une tâche subjective, une étiquette de référence agrégée unique efface le désaccord que l'information démographique aurait permis de voir. (Nous creusons cela dans Le désaccord est un signal, pas du bruit.)

Si votre tâche est le moindrement subjective, la composition de votre panel d'annotateurs est une propriété de votre jeu de données, et vous ne pouvez ni la rapporter ni l'auditer si vous n'avez jamais posé la question.

Quoi recueillir, et quoi laisser de côté

La tentation est de tout demander et de trier ensuite. Résistez-y. Chaque champ démographique recueilli est un champ à justifier, à sécuriser et, à terme, à rapporter, et certains sont juridiquement sensibles : origine, ethnicité, religion, opinion politique et données de santé sont des catégories particulières au sens du RGPD et emportent des obligations supplémentaires. Le réglage par défaut doit être le plus petit ensemble qui répond à votre vraie question.

Un test utile pour chaque champ : une différence sur cette dimension pourrait-elle plausiblement changer la façon dont quelqu'un étiquette vos données, et l'analyseriez-vous vraiment ? Si vous annotez le caractère offensant, le résultat de POPQUORN rend l'âge, l'origine et le niveau d'études défendables. Si vous annotez la grammaticalité d'une phrase, rien de tout cela n'a sa place dans le formulaire. Un attribut que vous ne regarderez jamais est un risque pris pour rien.

Deux pratiques gardent la démarche honnête :

  • Reliez chaque question à une analyse. Avant qu'un champ n'entre dans le formulaire, écrivez la comparaison que vous comptez faire avec lui. Pas de comparaison, pas de champ.
  • Rendez tout facultatif. Les questions sensibles ont besoin d'une vraie option « je préfère ne pas répondre », pas d'un bouton radio obligatoire. Une personne qui se sent contrainte de se déclarer abandonne ou vous donne une réponse bidon, et les deux valent moins qu'un blanc.

Bien traiter le consentement

Le recueil de données démographiques est le moment où l'annotation cesse d'être une tâche de données pour devenir un travail sur des personnes. La base est le consentement éclairé : avant que quiconque réponde à une question démographique, il doit savoir ce que vous recueillez, pourquoi, qui y aura accès, et qu'il peut arrêter à tout moment sans pénalité. En pratique, cela veut dire une page que l'annotateur lit et accepte avant le chargement des questions démographiques, pas une clause enfouie dans un mur de conditions d'utilisation.

Quelques éléments qui rendent le consentement réel plutôt que nominal :

  • Participation volontaire, garantie par l'interface. Le droit de refuser ne compte que si refuser est facile. Une option « je préfère ne pas répondre » sur chaque item sensible, et un moyen de quitter l'étude sans perdre la rémunération déjà acquise.
  • Auto-déclarées, jamais déduites. Les données démographiques doivent venir de l'annotateur, jamais être devinées à partir de son nom, de sa localisation ou de son écriture. Les attributs déduits sont souvent faux et constituent une atteinte à la vie privée pire que la question.
  • Stockage anonymisé. Séparez les réponses démographiques de tout ce qui identifie la personne. Vous voulez pouvoir dire « les évaluateurs qui se sont déclarés X ont noté cela plus haut » sans pouvoir désigner de quel individu il s'agissait.

Si vous travaillez au sein d'une université, cela passe en général par un comité d'éthique, qui s'intéressera précisément à ces points. Sinon, les points tiennent tout autant.

Un flux d'accueil d'annotation : une page de consentement éclairé conditionne un questionnaire démographique préalable, où chaque question sensible propose « je préfère ne pas répondre », et les réponses sont anonymisées avant d'atteindre la tâche d'annotation principale.Le consentement conditionne le questionnaire démographique ; chaque champ sensible peut être passé, et les réponses sont anonymisées avant le début de l'annotation

Les batteries démographiques standardisées

Quand vous recueillez une donnée démographique, la formulation compte plus qu'il n'y paraît. Les questions improvisées produisent des catégories qui ne s'alignent avec celles de personne, ne se comparent pas d'une étude à l'autre, et cadrent souvent mal les options, en particulier sur le genre et l'origine. Le remède est d'emprunter à des instruments que les sciences sociales affinent depuis des décennies : les batteries démographiques de l'American National Election Studies (ANES) ou du General Social Survey (GSS) vous donnent des formulations et des modalités de réponse éprouvées, défendables et comparables à un vaste corpus de travaux existants.

Recourir à une batterie standard fait aussi une partie du travail éthique à votre place. Ces instruments incluent déjà des options « je préfère ne pas répondre » et ont été relus quant à leur traitement des catégories sensibles : vous ne réinventez donc pas un jeu de choix qu'un comité relèverait.

Recueillir, puis rapporter

Recueillir des données démographiques et ne plus jamais en parler ruine l'objectif. La raison de les récolter est que vous, et tous ceux qui utiliseront ensuite le jeu de données, puissiez voir qui a produit les étiquettes. Ce compte rendu a une forme standard : une data statement (Bender et Friedman, 2018) comporte une section sur les données démographiques des annotateurs précisément pour que les utilisateurs en aval jugent de la généralisation possible des données, et les datasheets for datasets (Gebru et al.) demandent la même chose de tout jeu de données d'apprentissage. Planifiez la publication en même temps que le recueil : des distributions agrégées, jamais d'enregistrements individuels, et assez de détail pour qu'un lecteur voie si votre panel ressemble à la population que votre modèle servira. Nous traitons ce versant dans Documenter votre jeu de données d'annotation.

Le faire dans Potato

Potato a été conçu en partie pour cela. POPQUORN est le jeu de données « Potato-Prolific », recueilli en faisant tourner des études Potato sur Prolific : le flux consentement-démographie est donc intégré et non rapporté après coup.

L'accueil est un flux multi-phases : une phase consent qui conditionne l'étude, puis une phase prestudy qui recueille les données démographiques, puis l'annotation elle-même.

yaml
phases:
  consent:
    enabled: true
    data_file: "data/consent.json"
 
  prestudy:
    enabled: true
    data_file: "data/demographics.json"
 
  # annotation phase is always enabled

La page de consentement est une question dotée d'un right_label, la réponse requise pour continuer. Personne n'atteint les questions démographiques ni la tâche sans avoir accepté d'abord.

json
[
  {
    "name": "consent_agreement",
    "type": "radio",
    "description": "I have read the consent form, understand my responses are anonymized, and agree to participate. I may stop at any time.",
    "labels": ["I agree", "I do not agree"],
    "right_label": "I agree",
    "required": true
  }
]

Pour les questions démographiques elles-mêmes, donnez à chaque item sensible une option « je préfère ne pas répondre » et appuyez-vous sur les modèles intégrés pour les catégories délicates :

json
[
  {
    "name": "age_range",
    "type": "radio",
    "description": "What is your age range?",
    "labels": ["18-24", "25-34", "35-44", "45-54", "55+", "Prefer not to answer"]
  },
  {
    "name": "ethnicity",
    "type": "select",
    "description": "Which best describes you? (optional)",
    "template": "ethnicity",
    "free_response": true,
    "free_response_label": "Prefer to self-describe"
  }
]

Si vous préférez ne pas rédiger les questions du tout, Potato livre des instruments de questionnaire validés, dont huit batteries démographiques standardisées. Pointer une phase préalable vers les batteries ANES ou GSS vous donne gratuitement les formulations éprouvées :

yaml
phases:
  prestudy:
    type: prestudy
    instrument: "anes-demographics"   # or gss-demographics, acs-demographics, ...

La démonstration démographie-avec-consentement est une version prête à l'emploi de tout ce flux, et les instruments de questionnaire validés couvrent la bibliothèque plus large si vous voulez mesurer autre chose que la démographie.

Une fois l'étude lancée, les réponses démographiques sont stockées par annotateur à côté de ses étiquettes, ce qui permet l'analyse qui justifiait de les recueillir : ventiler l'accord par groupe, et vérifier si une caractéristique démographique prédit les étiquettes comme POPQUORN l'a constaté. Potato rapporte le kappa de Cohen et de Fleiss sur l'annotation, si bien que vous mesurez si l'appartenance à un groupe déplace les étiquettes au lieu de le supposer. Au moment de publier les données, les distributions agrégées issues de la phase préalable constituent la section démographie des annotateurs de votre data statement, déjà recueillie.

Où aller ensuite