Skip to content

Annotazione di esperti o di crowd

Quando gli annotatori non esperti eguagliano gli esperti, quanti ne servono per item, quanto costa ciascun approccio e come modellare la competenza degli annotatori invece di affidarsi al voto di maggioranza.

Usa annotatori di crowd quando una persona non specialista che segue con attenzione le tue linee guida arriverebbe allo stesso giudizio di uno specialista, e raccogli più giudizi per item invece di uno solo. Snow et al. (2008) hanno trovato che in media quattro annotazioni non esperte eguagliavano l'accordo di un singolo annotatore esperto su cinque compiti di linguaggio naturale.

La scelta tra annotatori esperti e di crowd viene di solito presentata come un compromesso tra qualità e costo, e per la maggior parte dei compiti è l'inquadramento sbagliato. La domanda è se il giudizio dipenda da una formazione che la crowd non ha. Sentiment, implicazione testuale e similarità lessicale per lo più non ne dipendono. Codifica clinica, classificazione giuridica e trascrizione fonetica per lo più sì.

Che cosa sostengono i dati

Il risultato fondativo viene da Snow et al. (2008), che hanno confrontato annotazioni non esperte raccolte su Amazon Mechanical Turk con gold standard prodotti da esperti su riconoscimento dell'affetto, similarità lessicale, riconoscimento dell'implicazione testuale, ordinamento temporale degli eventi e disambiguazione del senso delle parole. Aggregando i compiti, riportano che "servono solo 4 annotazioni non esperte per esempio per raggiungere l'ITA equivalente a quello di un singolo annotatore esperto" ("it requires only 4 non-expert annotations per example to achieve the equivalent ITA as a single expert annotator"). Per il costo indicano un tasso e non un rapporto: hanno raccolto 7000 annotazioni di affetto per due dollari e lo descrivono come "almeno 875 etichette equivalenti a quelle di un esperto per USD" ("at least 875 expert-equivalent labels per USD").

La variazione tra compiti dentro quella media conta più della media stessa. Nel loro compito sull'affetto, rabbia, disgusto e tristezza hanno raggiunto il livello degli esperti con due non esperti, la sorpresa ne ha richiesti nove, e la paura non lo ha mai raggiunto entro i dieci annotatori raccolti. Una media a livello di compito nasconde le etichette per cui la crowd non può sostituire la formazione.

Callison-Burch (2009) ha trovato lo stesso schema per la valutazione della traduzione automatica: ha ricreato i giudizi di WMT08 per dieci dollari e riporta che i giudizi non esperti combinati "correlano più fortemente con i giudizi degli esperti di quanto faccia Bleu" ("correlate more strongly with expert judgments than Bleu does").

Il contrappeso è che a volte gli esperti sono più veloci. Alfter et al. (2022) hanno condotto un compito di best-worst scaling su espressioni multiparola con parlanti di seconda lingua, professionisti della lingua ed esperti del QCER. Le graduatorie dei tre gruppi correlavano fortemente, quindi la qualità era paragonabile, ma l'annotazione diretta degli esperti ha richiesto da 15 a 90 minuti per progetto contro circa otto o nove ore per la versione con la crowd, che descrivono come "almeno cinque volte più veloce" ("at least five times as fast"). Dove è già disponibile un piccolo numero di specialisti, dirottare il lavoro su una crowd può costare più tempo di quanto ne faccia risparmiare.

Il meccanismo è la ridondanza, non la crowd

Un singolo giudizio della crowd è peggiore di un singolo giudizio esperto in tutti gli studi citati. Ciò che colma il divario è raccogliere più giudizi per item e combinarli, quindi la domanda progettuale è come combinarli.

Il voto di maggioranza tratta ogni annotatore come ugualmente affidabile, cosa che non è. Due modelli stimano invece l'affidabilità dai dati. Dawid and Skene (1979) hanno introdotto una procedura di aspettazione-massimizzazione che stima una matrice di confusione per ciascun osservatore insieme alle etichette vere latenti, in origine per l'errore degli osservatori clinici. MACE, ovvero Multi-Annotator Competence Estimation, è un modello di risposta all'item costruito per il caso del crowdsourcing, che impara senza supervisione quali annotatori siano affidabili e predice le etichette sottostanti. I suoi autori lo hanno costruito perché "alcuni annotatori scelgono etichette sbagliate per massimizzare il proprio compenso" ("some annotators choose bad labels in order to maximize their pay"), una modalità di guasto che il voto di maggioranza assorbe in silenzio quando abbastanza annotatori la condividono.

Potato include entrambi. Un blocco mace esegue la stima della competenza sulle annotazioni raccolte, e il calcolatore Dawid-Skene applica lo stimatore alle etichette che incolli.

yaml
mace:
  enabled: true
 
num_annotators_per_item: 4
 
gold_standards:
  enabled: true
 
attention_checks:
  enabled: true

num_annotators_per_item: 4 segue il risultato di Snow et al. e non un valore predefinito della casa, ed è il valore da rivedere per ogni compito invece di portarselo dietro da un progetto all'altro. I gold standard e i controlli di attenzione intercettano l'annotatore che non sta leggendo, cosa che i modelli di competenza gestiscono meglio quando hanno alcuni item ancorati su cui calibrarsi.

Il disaccordo non è automaticamente un errore

Trattare ogni disaccordo come un problema di qualità porta all'intervento sbagliato. Plank et al. (2014) hanno analizzato i disaccordi tra annotatori nell'annotazione delle parti del discorso e hanno trovato che "solo il 2% delle scelte degli annotatori è linguisticamente immotivato" ("only 2% of annotator choices are linguistically unmotivated"), concludendo che la maggior parte dei disaccordi deriva da casi linguisticamente discutibili e non da errori.

Pavlick and Kwiatkowski (2019) hanno verificato se il disaccordo nell'inferenza in linguaggio naturale sparisca con più dati, e non sparisce. Riportano che i disaccordi "non sono liquidabili come 'rumore' di annotazione, ma persistono man mano che raccogliamo più valutazioni e man mano che variamo la quantità di contesto fornita ai valutatori" ("are not dismissible as annotation 'noise', but rather persist as we collect more ratings and as we vary the amount of context provided to raters"). Plank (2022) generalizza il punto come variazione umana delle etichette.

La verifica pratica costa poco. Raccogli più giudizi sugli item su cui gli annotatori divergono. Se l'accordo converge, il disaccordo era rumore e la ridondanza lo risolve. Se resta piatto, l'item è davvero ambiguo, e la risposta giusta è registrare la distribuzione invece di forzare un'etichetta unica.

La formazione cambia l'accordo più del tipo di annotatore

Bayerl and Paul (2011) hanno condotto una meta-analisi di 96 studi di annotazione su disambiguazione del senso delle parole, trascrizione prosodica e trascrizione fonetica, per un totale di 346 indici di accordo. Sette fattori spiegavano la variazione nell'accordo, e due di essi riguardano la formazione, cioè se gli annotatori abbiano ricevuto formazione e quanto fosse intensiva. Gli altri sono il dominio di annotazione, il numero di categorie nello schema, il numero di annotatori, lo scopo dell'annotazione e il metodo usato per calcolare la percentuale di accordo.

Quel risultato riformula la decisione tra esperti e crowd. Un annotatore di crowd formato che lavora su uno schema testato con poche categorie spesso raggiungerà un accordo più alto di uno specialista non formato che lavora su uno schema vago. Scrivere linee guida di annotazione e scegliere uno schema di annotazione contano per l'accordo più del canale di reclutamento.

Dove l'annotazione di crowd fallisce

Tre condizioni rendono la crowd la scelta sbagliata. Il giudizio richiede conoscenza certificata, come nella codifica clinica o giuridica, dove un'etichetta sbagliata non è solo rumorosa. I dati non possono uscire dalla tua infrastruttura, il che esclude un marketplace pubblico a prescindere dalla qualità. L'insieme di etichette è abbastanza ampio o gerarchico da far sì che il costo di formazione per annotatore superi il risparmio, cosa comune sopra all'incirca qualche decina di categorie.

Quando vale la prima condizione ma il volume è alto, un disegno misto di solito batte entrambi gli estremi. Gli esperti etichettano un sottoinsieme, quel sottoinsieme diventa il gold standard, e gli annotatori di crowd vengono filtrati su di esso prima di arrivare al compito vero. Gold standard e controlli di attenzione copre la meccanica del filtraggio.

Letture successive

Riferimenti

Snow, R., O'Connor, B., Jurafsky, D., and Ng, A. Y. (2008). Cheap and Fast – But is it Good? Evaluating Non-Expert Annotations for Natural Language Tasks. Proceedings of EMNLP 2008, 254-263. https://aclanthology.org/D08-1027/

Callison-Burch, C. (2009). Fast, Cheap, and Creative: Evaluating Translation Quality Using Amazon's Mechanical Turk. Proceedings of EMNLP 2009, 286-295. https://aclanthology.org/D09-1030/

Dawid, A. P., and Skene, A. M. (1979). Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm. Journal of the Royal Statistical Society. Series C (Applied Statistics), 28(1), 20-28. https://doi.org/10.2307/2346806

Hovy, D., Berg-Kirkpatrick, T., Vaswani, A., and Hovy, E. (2013). Learning Whom to Trust with MACE. Proceedings of NAACL-HLT 2013, 1120-1130. https://aclanthology.org/N13-1132/

Plank, B., Hovy, D., and Søgaard, A. (2014). Linguistically debatable or just plain wrong? Proceedings of ACL 2014 (Volume 2: Short Papers), 507-511. https://doi.org/10.3115/v1/P14-2083

Pavlick, E., and Kwiatkowski, T. (2019). Inherent Disagreements in Human Textual Inferences. Transactions of the Association for Computational Linguistics, 7, 677-694. https://aclanthology.org/Q19-1043/

Bayerl, P. S., and Paul, K. I. (2011). What Determines Inter-Coder Agreement in Manual Annotations? A Meta-Analytic Investigation. Computational Linguistics, 37(4), 699-725. https://doi.org/10.1162/COLI_a_00074

Alfter, D., Lindström Tiedemann, T., and Volodina, E. (2022). Crowdsourcing Relative Rankings of Multi-Word Expressions: Experts versus Non-Experts. Northern European Journal of Language Technology, 7(1). https://doi.org/10.3384/nejlt.2000-1533.2021.3128

Plank, B. (2022). The "Problem" of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation. Proceedings of EMNLP 2022, 10671-10682. https://doi.org/10.18653/v1/2022.emnlp-main.731