Anotación por expertos frente a anotación por multitud
Cuándo los anotadores no expertos igualan a los expertos, cuántos hacen falta por ítem, qué cuesta cada enfoque y cómo modelar la competencia del anotador en lugar de fiarse del voto mayoritario.
Usa anotadores de multitud cuando una persona no especialista que siga con atención tus directrices llegaría al mismo juicio que un especialista, y recoge varios juicios por ítem en lugar de uno. Snow et al. (2008) encontraron que una media de cuatro anotaciones no expertas igualaba el acuerdo de un único anotador experto en cinco tareas de lenguaje natural.
La elección entre anotadores expertos y de multitud se suele plantear como un compromiso entre calidad y coste, y ese es el marco equivocado para la mayoría de las tareas. La pregunta es si el juicio depende de una formación que la multitud no tiene. El sentimiento, la inferencia textual y la similitud entre palabras en general no dependen de ella. La codificación clínica, la clasificación jurídica y la transcripción fonética en general sí.
Qué respalda la evidencia
El resultado fundacional procede de Snow et al. (2008), que compararon anotaciones no expertas de Amazon Mechanical Turk con estándares de oro elaborados por expertos en reconocimiento de afecto, similitud entre palabras, reconocimiento de inferencia textual, ordenación temporal de eventos y desambiguación del sentido de las palabras. Agregando todas las tareas, informan de que "hacen falta solo 4 anotaciones no expertas por ejemplo para alcanzar el mismo ITA que un único anotador experto" ("it requires only 4 non-expert annotations per example to achieve the equivalent ITA as a single expert annotator"). Para el coste dan una tasa y no una proporción: recogieron 7000 anotaciones de afecto por dos dólares y lo describen como "al menos 875 etiquetas equivalentes a las de un experto por dólar" ("at least 875 expert-equivalent labels per USD").
La variación entre tareas dentro de esa media importa más que la media. En su tarea de afecto, la ira, el asco y la tristeza alcanzaron el nivel experto con dos no expertos, la sorpresa necesitó nueve, y el miedo no lo alcanzó nunca dentro de los diez anotadores que recogieron. Una media por tarea oculta las etiquetas en las que la multitud no puede sustituir a la formación.
Callison-Burch (2009) encontró el mismo patrón en la evaluación de traducción automática: recreó los juicios de WMT08 por diez dólares e informó de que los juicios no expertos combinados "correlacionan más fuertemente con los juicios de los expertos que Bleu" ("correlate more strongly with expert judgments than Bleu does").
El contrapeso es que a veces los expertos son más rápidos. Alfter et al. (2022) ejecutaron una tarea de escalamiento best-worst sobre expresiones multipalabra con hablantes de segunda lengua, profesionales de la lengua y expertos en el MCER. Las clasificaciones de los tres grupos correlacionaron alto, así que la calidad era comparable, pero la anotación directa por expertos llevó de 15 a 90 minutos por proyecto frente a unas ocho o nueve horas de la versión con multitud, lo que describen como "al menos cinco veces más rápido" ("at least five times as fast"). Donde ya se dispone de un número pequeño de especialistas, derivar el trabajo a una multitud puede costar más tiempo del que ahorra.
La redundancia es el mecanismo, no la multitud
Un único juicio de la multitud es peor que un único juicio experto en todos los estudios anteriores. Lo que cierra la brecha es recoger varios juicios por ítem y combinarlos, así que la pregunta de diseño es cómo combinarlos.
El voto mayoritario trata a todos los anotadores como igual de fiables, y no lo son. Dos modelos estiman la fiabilidad a partir de los propios datos. Dawid and Skene (1979) introdujeron un procedimiento de esperanza-maximización que estima una matriz de confusión por observador junto con las etiquetas verdaderas latentes, originalmente para el error de observadores clínicos. MACE, o Multi-Annotator Competence Estimation, es un modelo de respuesta al ítem construido para el caso del crowdsourcing, que aprende sin supervisión qué anotadores son de fiar y predice las etiquetas subyacentes. Sus autores lo construyeron porque "algunos anotadores eligen etiquetas malas para maximizar su paga" ("some annotators choose bad labels in order to maximize their pay"), un modo de fallo que el voto mayoritario absorbe en silencio cuando bastantes anotadores lo comparten.
Potato incluye ambos. Un bloque mace ejecuta la estimación de competencia sobre las anotaciones recogidas, y la calculadora de Dawid-Skene ejecuta el estimador sobre las etiquetas que pegues.
mace:
enabled: true
num_annotators_per_item: 4
gold_standards:
enabled: true
attention_checks:
enabled: truenum_annotators_per_item: 4 sigue el hallazgo de Snow et al. y no un valor por defecto de la casa, y es el valor que conviene revisar en cada tarea en vez de arrastrarlo de un proyecto a otro. Los estándares de oro y los controles de atención detectan al anotador que no está leyendo, algo que los modelos de competencia manejan mejor cuando tienen algunos ítems anclados con los que calibrarse.
El desacuerdo no es error automáticamente
Tratar cada desacuerdo como un problema de calidad lleva a la intervención equivocada. Plank et al. (2014) analizaron los desacuerdos entre anotadores en la anotación morfosintáctica y encontraron que "solo el 2% de las elecciones de los anotadores carecen de motivación lingüística" ("only 2% of annotator choices are linguistically unmotivated"), y concluyeron que la mayoría de los desacuerdos vienen de casos lingüísticamente discutibles y no de errores.
Pavlick and Kwiatkowski (2019) comprobaron si el desacuerdo en la inferencia en lenguaje natural desaparece con más datos, y no desaparece. Informan de que los desacuerdos "no son descartables como 'ruido' de anotación, sino que persisten a medida que recogemos más valoraciones y a medida que variamos la cantidad de contexto que se da a los evaluadores" ("are not dismissible as annotation 'noise', but rather persist as we collect more ratings and as we vary the amount of context provided to raters"). Plank (2022) generaliza el punto como variación humana de etiqueta.
La prueba práctica es barata. Recoge más juicios sobre los ítems en los que los anotadores discrepan. Si el acuerdo converge, el desacuerdo era ruido y la redundancia lo arregla. Si se mantiene plano, el ítem es genuinamente ambiguo, y la respuesta correcta es registrar la distribución en vez de forzar una única etiqueta.
La formación cambia el acuerdo más que el tipo de anotador
Bayerl and Paul (2011) hicieron un metaanálisis de 96 estudios de anotación sobre desambiguación del sentido de las palabras, transcripción prosódica y transcripción fonética, que cubría 346 índices de acuerdo. Siete factores explicaban la variación en el acuerdo, y dos de ellos tienen que ver con la formación: si los anotadores recibieron formación y cuán intensiva fue. Los demás son el dominio de anotación, el número de categorías del esquema, el número de anotadores, el propósito de la anotación y el método usado para calcular el porcentaje de acuerdo.
Ese resultado replantea la decisión entre expertos y multitud. Un anotador de multitud formado que trabaja con un esquema probado y pocas categorías a menudo tendrá más acuerdo que un especialista sin formación que trabaja con uno vago. Escribir directrices de anotación y elegir un esquema de anotación hacen más por el acuerdo que el canal de reclutamiento.
Dónde falla la anotación por multitud
Tres condiciones hacen que la multitud sea la elección equivocada. El juicio requiere conocimiento acreditado, como en la codificación clínica o jurídica, donde una etiqueta equivocada no es solo ruidosa. Los datos no pueden salir de tu infraestructura, lo que descarta un mercado público sea cual sea la calidad. El conjunto de etiquetas es lo bastante grande o jerárquico como para que el coste de formación por anotador supere el ahorro, algo habitual por encima de unas pocas decenas de categorías.
Cuando se da la primera condición pero el volumen es alto, un diseño mixto suele ganar a cualquiera de los dos extremos. Los expertos etiquetan un subconjunto, ese subconjunto se convierte en el estándar de oro, y los anotadores de multitud se filtran contra él antes de llegar a la tarea real. Estándares de oro y controles de atención cubre la mecánica del filtrado.
Lecturas adicionales
- ¿Cuántos anotadores necesitas? desarrolla la redundancia y la potencia estadística.
- Agregar etiquetas de multitud cubre cómo combinar los juicios una vez recogidos.
- Crowdsourcing con Prolific y MTurk cubre el reclutamiento y el pago.
- El acuerdo entre anotadores explicado cubre los coeficientes.
Referencias
Snow, R., O'Connor, B., Jurafsky, D., and Ng, A. Y. (2008). Cheap and Fast – But is it Good? Evaluating Non-Expert Annotations for Natural Language Tasks. Proceedings of EMNLP 2008, 254-263. https://aclanthology.org/D08-1027/
Callison-Burch, C. (2009). Fast, Cheap, and Creative: Evaluating Translation Quality Using Amazon's Mechanical Turk. Proceedings of EMNLP 2009, 286-295. https://aclanthology.org/D09-1030/
Dawid, A. P., and Skene, A. M. (1979). Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm. Journal of the Royal Statistical Society. Series C (Applied Statistics), 28(1), 20-28. https://doi.org/10.2307/2346806
Hovy, D., Berg-Kirkpatrick, T., Vaswani, A., and Hovy, E. (2013). Learning Whom to Trust with MACE. Proceedings of NAACL-HLT 2013, 1120-1130. https://aclanthology.org/N13-1132/
Plank, B., Hovy, D., and Søgaard, A. (2014). Linguistically debatable or just plain wrong? Proceedings of ACL 2014 (Volume 2: Short Papers), 507-511. https://doi.org/10.3115/v1/P14-2083
Pavlick, E., and Kwiatkowski, T. (2019). Inherent Disagreements in Human Textual Inferences. Transactions of the Association for Computational Linguistics, 7, 677-694. https://aclanthology.org/Q19-1043/
Bayerl, P. S., and Paul, K. I. (2011). What Determines Inter-Coder Agreement in Manual Annotations? A Meta-Analytic Investigation. Computational Linguistics, 37(4), 699-725. https://doi.org/10.1162/COLI_a_00074
Alfter, D., Lindström Tiedemann, T., and Volodina, E. (2022). Crowdsourcing Relative Rankings of Multi-Word Expressions: Experts versus Non-Experts. Northern European Journal of Language Technology, 7(1). https://doi.org/10.3384/nejlt.2000-1533.2021.3128
Plank, B. (2022). The "Problem" of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation. Proceedings of EMNLP 2022, 10671-10682. https://doi.org/10.18653/v1/2022.emnlp-main.731