Anotação por especialistas ou por multidão
Quando anotadores da multidão igualam especialistas, quantos são precisos por item, quanto custa cada abordagem e como modelar a competência dos anotadores em vez de confiar no voto da maioria.
Use anotadores da multidão quando uma pessoa não especialista que siga com atenção as suas diretrizes chegaria ao mesmo juízo que um especialista, e recolha vários juízos por item em vez de um só. Snow et al. (2008) verificaram que uma média de quatro anotações não especializadas igualava a concordância de um único anotador especialista em cinco tarefas de linguagem natural.
A escolha entre anotadores especialistas e da multidão costuma ser apresentada como um compromisso entre qualidade e custo, e esse é o enquadramento errado para a maioria das tarefas. A pergunta é se o juízo depende de formação que a multidão não tem. Sentimento, implicação textual e semelhança entre palavras em geral não dependem. Codificação clínica, classificação jurídica e transcrição fonética em geral dependem.
O que a evidência sustenta
O resultado fundador vem de Snow et al. (2008), que compararam anotações não especializadas da Amazon Mechanical Turk com padrões de ouro produzidos por especialistas em reconhecimento de afeto, semelhança entre palavras, reconhecimento de implicação textual, ordenação temporal de eventos e desambiguação do sentido das palavras. Agregando as tarefas, relatam que "são precisas apenas 4 anotações não especializadas por exemplo para atingir o ITA equivalente ao de um único anotador especialista" ("it requires only 4 non-expert annotations per example to achieve the equivalent ITA as a single expert annotator"). Para o custo dão uma taxa e não uma razão: recolheram 7000 anotações de afeto por dois dólares e descrevem isso como "pelo menos 875 etiquetas equivalentes a especialista por USD" ("at least 875 expert-equivalent labels per USD").
A variação entre tarefas dentro dessa média importa mais do que a média. Na tarefa de afeto, raiva, nojo e tristeza atingiram o nível de especialista com dois não especialistas, a surpresa precisou de nove, e o medo nunca o atingiu dentro dos dez anotadores recolhidos. Uma média ao nível da tarefa esconde as etiquetas em que a multidão não substitui a formação.
Callison-Burch (2009) encontrou o mesmo padrão na avaliação de tradução automática: recriou os juízos do WMT08 por dez dólares e relata que os juízos não especializados combinados "correlacionam-se mais fortemente com os juízos de especialistas do que o Bleu" ("correlate more strongly with expert judgments than Bleu does").
O contrapeso é que os especialistas às vezes são mais rápidos. Alfter et al. (2022) fizeram uma tarefa de best-worst scaling sobre expressões multipalavra com falantes de segunda língua, profissionais da língua e especialistas do QECR. As ordenações dos três grupos correlacionaram-se fortemente, portanto a qualidade era comparável, mas a anotação direta por especialistas levou de 15 a 90 minutos por projeto contra cerca de oito a nove horas na versão com multidão, o que descrevem como "pelo menos cinco vezes mais rápido" ("at least five times as fast"). Onde já existe um pequeno número de especialistas disponível, encaminhar o trabalho para uma multidão pode custar mais tempo do que poupa.
O mecanismo é a redundância, não a multidão
Um juízo isolado da multidão é pior do que um juízo isolado de especialista em todos os estudos acima. O que fecha a diferença é recolher vários juízos por item e combiná-los, pelo que a questão de desenho é como combiná-los.
O voto da maioria trata todos os anotadores como igualmente fiáveis, o que não são. Dois modelos estimam a fiabilidade a partir dos dados. Dawid and Skene (1979) introduziram um procedimento de esperança-maximização que estima uma matriz de confusão por observador juntamente com as etiquetas verdadeiras latentes, originalmente para o erro de observadores clínicos. MACE, ou Multi-Annotator Competence Estimation, é um modelo de resposta ao item construído para o caso do crowdsourcing, que aprende sem supervisão quais anotadores são de confiança e prevê as etiquetas subjacentes. Os autores construíram-no porque "alguns anotadores escolhem etiquetas más para maximizar o seu pagamento" ("some annotators choose bad labels in order to maximize their pay"), um modo de falha que o voto da maioria absorve em silêncio quando anotadores suficientes o partilham.
O Potato traz os dois. Um bloco mace corre a estimação de competência sobre as anotações recolhidas, e a calculadora de Dawid-Skene corre o estimador sobre as etiquetas que colar.
mace:
enabled: true
num_annotators_per_item: 4
gold_standards:
enabled: true
attention_checks:
enabled: truenum_annotators_per_item: 4 segue o resultado de Snow et al. e não uma predefinição da casa, e é o valor a rever em cada tarefa em vez de o levar de projeto para projeto. Padrões de ouro e verificações de atenção apanham o anotador que não está a ler, coisa que os modelos de competência tratam melhor quando têm alguns itens ancorados para se calibrarem.
A discordância não é automaticamente erro
Tratar toda a discordância como problema de qualidade leva à intervenção errada. Plank et al. (2014) analisaram discordâncias entre anotadores na anotação de classes de palavras e verificaram que "apenas 2% das escolhas dos anotadores são linguisticamente imotivadas" ("only 2% of annotator choices are linguistically unmotivated"), concluindo que a maioria das discordâncias vem de casos linguisticamente discutíveis e não de erros.
Pavlick and Kwiatkowski (2019) testaram se a discordância em inferência de linguagem natural desaparece com mais dados, e não desaparece. Relatam que as discordâncias "não são descartáveis como 'ruído' de anotação, antes persistem à medida que recolhemos mais avaliações e à medida que variamos a quantidade de contexto dada aos avaliadores" ("are not dismissible as annotation 'noise', but rather persist as we collect more ratings and as we vary the amount of context provided to raters"). Plank (2022) generaliza o ponto como variação humana de etiqueta.
O teste prático é barato. Recolha mais juízos sobre os itens em que os anotadores divergem. Se a concordância convergir, a discordância era ruído e a redundância resolve-a. Se ficar plana, o item é genuinamente ambíguo, e a resposta certa é registar a distribuição em vez de forçar uma única etiqueta.
A formação muda a concordância mais do que o tipo de anotador
Bayerl and Paul (2011) fizeram uma meta-análise de 96 estudos de anotação sobre desambiguação do sentido das palavras, transcrição prosódica e transcrição fonética, cobrindo 346 índices de concordância. Sete fatores explicavam a variação na concordância, e dois deles dizem respeito à formação, nomeadamente se os anotadores receberam formação e quão intensiva ela foi. Os restantes são o domínio de anotação, o número de categorias no esquema, o número de anotadores, o propósito da anotação e o método usado para calcular a percentagem de concordância.
Esse resultado reformula a decisão entre especialistas e multidão. Um anotador da multidão com formação, a trabalhar a partir de um esquema testado com poucas categorias, concordará muitas vezes mais do que um especialista sem formação a trabalhar a partir de um esquema vago. Escrever diretrizes de anotação e escolher um esquema de anotação fazem mais pela concordância do que o canal de recrutamento.
Onde a anotação por multidão falha
Três condições tornam a multidão a escolha errada. O juízo exige conhecimento credenciado, como na codificação clínica ou jurídica, onde uma etiqueta errada não é apenas ruidosa. Os dados não podem sair da sua infraestrutura, o que exclui um mercado público independentemente da qualidade. O conjunto de etiquetas é grande ou hierárquico ao ponto de o custo de formação por anotador exceder a poupança, o que é comum acima de umas poucas dezenas de categorias.
Quando a primeira condição se verifica mas o volume é alto, um desenho misto costuma bater qualquer dos extremos. Os especialistas etiquetam um subconjunto, esse subconjunto passa a padrão de ouro, e os anotadores da multidão são filtrados contra ele antes de chegarem à tarefa real. Padrões de ouro e verificações de atenção cobre a mecânica da filtragem.
Leitura adicional
- De quantos anotadores precisa? desenvolve a redundância e o poder estatístico.
- Agregar etiquetas da multidão cobre a combinação dos juízos depois de recolhidos.
- Crowdsourcing com Prolific e MTurk cobre recrutamento e pagamento.
- A concordância entre anotadores explicada cobre os coeficientes.
Referências
Snow, R., O'Connor, B., Jurafsky, D., and Ng, A. Y. (2008). Cheap and Fast – But is it Good? Evaluating Non-Expert Annotations for Natural Language Tasks. Proceedings of EMNLP 2008, 254-263. https://aclanthology.org/D08-1027/
Callison-Burch, C. (2009). Fast, Cheap, and Creative: Evaluating Translation Quality Using Amazon's Mechanical Turk. Proceedings of EMNLP 2009, 286-295. https://aclanthology.org/D09-1030/
Dawid, A. P., and Skene, A. M. (1979). Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm. Journal of the Royal Statistical Society. Series C (Applied Statistics), 28(1), 20-28. https://doi.org/10.2307/2346806
Hovy, D., Berg-Kirkpatrick, T., Vaswani, A., and Hovy, E. (2013). Learning Whom to Trust with MACE. Proceedings of NAACL-HLT 2013, 1120-1130. https://aclanthology.org/N13-1132/
Plank, B., Hovy, D., and Søgaard, A. (2014). Linguistically debatable or just plain wrong? Proceedings of ACL 2014 (Volume 2: Short Papers), 507-511. https://doi.org/10.3115/v1/P14-2083
Pavlick, E., and Kwiatkowski, T. (2019). Inherent Disagreements in Human Textual Inferences. Transactions of the Association for Computational Linguistics, 7, 677-694. https://aclanthology.org/Q19-1043/
Bayerl, P. S., and Paul, K. I. (2011). What Determines Inter-Coder Agreement in Manual Annotations? A Meta-Analytic Investigation. Computational Linguistics, 37(4), 699-725. https://doi.org/10.1162/COLI_a_00074
Alfter, D., Lindström Tiedemann, T., and Volodina, E. (2022). Crowdsourcing Relative Rankings of Multi-Word Expressions: Experts versus Non-Experts. Northern European Journal of Language Technology, 7(1). https://doi.org/10.3384/nejlt.2000-1533.2021.3128
Plank, B. (2022). The "Problem" of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation. Proceedings of EMNLP 2022, 10671-10682. https://doi.org/10.18653/v1/2022.emnlp-main.731