전문가 주석과 크라우드 주석
크라우드 작업자가 전문가와 맞먹는 경우, 항목당 몇 명이 필요한지, 각 방식의 비용은 얼마인지, 다수결에 기대는 대신 주석자의 역량을 모델링하는 방법.
지침을 꼼꼼히 따른 비전문가가 전문가와 같은 판단에 도달할 과제라면 크라우드 작업자를 쓰고, 항목당 하나가 아니라 여러 건의 판단을 모으라. Snow et al. (2008) 은 다섯 개 자연어 과제에서 평균 네 건의 비전문가 주석이 전문가 주석자 한 명의 일치도와 맞먹는다는 것을 확인했다.
전문가와 크라우드 사이의 선택은 대개 품질과 비용의 절충으로 설명되는데, 대부분의 과제에서는 그것이 잘못된 틀이다. 물어야 할 것은 그 판단이 크라우드가 갖지 못한 훈련에 의존하는가이다. 감성, 텍스트 함의, 단어 유사도는 대체로 의존하지 않는다. 임상 코딩, 법률 분류, 음성 전사는 대체로 의존한다.
근거가 뒷받침하는 것
기초가 되는 결과는 Snow et al. (2008) 에서 나온다. 이들은 Amazon Mechanical Turk 의 비전문가 주석을 정서 인식, 단어 유사도, 텍스트 함의 인식, 사건의 시간 순서 배열, 단어 의미 중의성 해소에서 전문가 골드 스탠다드와 비교했다. 과제를 합쳐 보면, "전문가 주석자 한 명과 동등한 ITA 를 얻는 데 예시당 비전문가 주석 4 건이면 충분하다"("it requires only 4 non-expert annotations per example to achieve the equivalent ITA as a single expert annotator")고 보고한다. 비용에 대해서는 비율이 아니라 단가를 제시하는데, 정서 주석 7,000 건을 2 달러에 모았고 이를 "USD 당 최소 875 개의 전문가 동등 레이블"("at least 875 expert-equivalent labels per USD")이라고 표현한다.
그 평균 안에 있는 과제별 편차가 평균 자체보다 중요하다. 정서 과제에서 분노, 혐오, 슬픔은 비전문가 두 명으로 전문가 수준에 도달했고, 놀람은 아홉 명이 필요했으며, 두려움은 이들이 모은 열 명 안에서는 끝내 도달하지 못했다. 과제 단위 평균은 크라우드가 훈련을 대신할 수 없는 레이블을 가린다.
Callison-Burch (2009) 는 기계 번역 평가에서 같은 양상을 발견했다. WMT08 의 판단을 10 달러로 재현했고, 결합한 비전문가 판단이 "Bleu 보다 전문가 판단과 더 강하게 상관한다"("correlate more strongly with expert judgments than Bleu does")고 보고한다.
반대편의 무게추는 전문가가 더 빠를 때가 있다는 점이다. Alfter et al. (2022) 는 제2언어 화자, 언어 전문 직업인, CEFR 전문가를 대상으로 다단어 표현에 대한 best-worst scaling 과제를 수행했다. 세 집단의 순위는 높게 상관해 품질은 비슷했지만, 전문가의 직접 주석은 프로젝트당 15 분에서 90 분이 걸린 반면 크라우드 방식은 대략 8 시간에서 9 시간이 걸렸고, 이들은 이를 "적어도 다섯 배 빠르다"("at least five times as fast")고 표현한다. 소수의 전문가를 이미 확보한 상황이라면, 작업을 크라우드로 돌리는 편이 아끼는 시간보다 더 많은 시간을 쓰게 만들 수 있다.
작동하는 것은 중복성이지 크라우드가 아니다
위의 모든 연구에서 크라우드의 판단 하나는 전문가의 판단 하나보다 못하다. 격차를 메우는 것은 항목당 여러 판단을 모아 결합하는 일이고, 따라서 설계상의 질문은 그것을 어떻게 결합하느냐가 된다.
다수결은 모든 주석자를 똑같이 신뢰할 수 있다고 취급하지만 실제로는 그렇지 않다. 대신 신뢰도를 데이터에서 추정하는 모델이 두 가지 있다. Dawid and Skene (1979) 는 관측자별 혼동 행렬과 잠재된 참 레이블을 함께 추정하는 기댓값 최대화 절차를 도입했는데, 원래는 임상 관측자 오류를 위한 것이었다. MACE, 곧 Multi-Annotator Competence Estimation 은 크라우드소싱 상황을 위해 만들어진 문항 반응 모델로, 어떤 주석자가 믿을 만한지를 지도 없이 학습하고 그 아래에 있는 레이블을 예측한다. 저자들이 이것을 만든 이유는 "일부 주석자는 보수를 극대화하려고 나쁜 레이블을 고른다"("some annotators choose bad labels in order to maximize their pay")는 데 있으며, 이 고장 양상은 충분히 많은 주석자가 같은 행동을 하면 다수결이 소리 없이 흡수해 버린다.
Potato 는 둘 다 제공한다. mace 블록은 수집된 주석에 대해 역량 추정을 실행하고, Dawid-Skene 계산기는 붙여 넣은 레이블에 추정기를 적용한다.
mace:
enabled: true
num_annotators_per_item: 4
gold_standards:
enabled: true
attention_checks:
enabled: truenum_annotators_per_item: 4 는 사내 기본값이 아니라 Snow et al. 의 결과를 따른 것이며, 프로젝트마다 그대로 옮길 값이 아니라 과제마다 다시 따져 볼 값이다. 골드 스탠다드와 주의력 확인은 읽지 않는 주석자를 잡아내며, 역량 모델은 보정 기준이 될 고정된 항목이 몇 개 있을 때 더 잘 작동한다.
불일치가 곧 오류는 아니다
모든 불일치를 품질 문제로 다루면 엉뚱한 조치를 하게 된다. Plank et al. (2014) 는 품사 주석에서 주석자 간 불일치를 분석해 "주석자 선택 가운데 언어학적으로 동기가 없는 것은 2% 뿐"("only 2% of annotator choices are linguistically unmotivated")이라는 것을 확인했고, 불일치의 대부분이 오류가 아니라 언어학적으로 논쟁의 여지가 있는 사례에서 온다고 결론지었다.
Pavlick and Kwiatkowski (2019) 는 자연어 추론에서의 불일치가 데이터를 늘리면 사라지는지 검증했고, 사라지지 않았다. 이들은 불일치가 "주석 '잡음'으로 치워 버릴 수 있는 것이 아니라, 평가를 더 모아도, 평가자에게 주는 맥락의 양을 바꾸어도 계속 남는다"("are not dismissible as annotation 'noise', but rather persist as we collect more ratings and as we vary the amount of context provided to raters")고 보고한다. Plank (2022) 는 이 점을 인간 레이블 변이로 일반화한다.
실무적인 검사는 값이 싸다. 주석자들이 갈리는 항목에 대해 판단을 더 모으라. 일치도가 수렴하면 그 불일치는 잡음이었고 중복성이 해결한다. 그대로라면 그 항목은 진짜로 모호한 것이고, 올바른 대응은 단일 레이블을 강요하는 대신 분포를 기록하는 것이다.
일치도는 주석자 유형보다 훈련이 더 크게 좌우한다
Bayerl and Paul (2011) 은 단어 의미 중의성 해소, 운율 전사, 음성 전사에 걸친 96 편의 주석 연구를 메타분석했고, 346 개의 일치도 지표를 다루었다. 일치도의 변이를 설명한 요인은 일곱 가지였고, 그중 둘이 훈련과 관련된다. 곧 주석자가 훈련을 받았는지, 그리고 그 훈련이 얼마나 집중적이었는지다. 나머지는 주석 영역, 스키마의 범주 수, 주석자 수, 주석의 목적, 그리고 백분율 일치도를 계산한 방법이다.
이 결과는 전문가냐 크라우드냐 하는 결정을 다시 짜게 만든다. 범주가 적고 검증된 스키마로 작업하는, 훈련받은 크라우드 주석자는 모호한 스키마로 작업하는 훈련받지 않은 전문가보다 더 높은 일치도를 보이는 경우가 많다. 일치도에는 모집 경로보다 주석 지침 작성하기와 주석 스키마 고르기가 더 크게 기여한다.
크라우드 주석이 통하지 않는 곳
크라우드를 잘못된 선택으로 만드는 조건이 셋 있다. 임상이나 법률 코딩처럼 판단에 자격을 갖춘 지식이 필요하고, 레이블이 틀리면 단순한 잡음으로 끝나지 않는 경우. 데이터가 자체 인프라를 벗어날 수 없어, 품질과 무관하게 공개 마켓플레이스가 배제되는 경우. 레이블 집합이 크거나 계층적이어서 주석자 한 명당 훈련 비용이 절감액을 넘어서는 경우이며, 이는 대략 수십 개 범주를 넘으면 흔하다.
첫 번째 조건이 성립하는데 분량이 많다면, 대개 혼합 설계가 양극단보다 낫다. 전문가가 일부를 레이블링하고, 그 일부가 골드 스탠다드가 되며, 크라우드 주석자는 실제 과제에 들어가기 전에 그것으로 걸러진다. 선별 방식은 골드 스탠다드와 주의력 확인에서 다룬다.
더 읽을거리
- 주석자는 몇 명이 필요한가는 중복성과 통계적 검정력을 차례로 다룬다.
- 크라우드 레이블 집계하기는 모은 판단을 결합하는 법을 다룬다.
- Prolific 과 MTurk 로 크라우드소싱하기는 모집과 지급을 다룬다.
- 주석자 간 일치도 설명은 계수들을 다룬다.
참고문헌
Snow, R., O'Connor, B., Jurafsky, D., and Ng, A. Y. (2008). Cheap and Fast – But is it Good? Evaluating Non-Expert Annotations for Natural Language Tasks. Proceedings of EMNLP 2008, 254-263. https://aclanthology.org/D08-1027/
Callison-Burch, C. (2009). Fast, Cheap, and Creative: Evaluating Translation Quality Using Amazon's Mechanical Turk. Proceedings of EMNLP 2009, 286-295. https://aclanthology.org/D09-1030/
Dawid, A. P., and Skene, A. M. (1979). Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm. Journal of the Royal Statistical Society. Series C (Applied Statistics), 28(1), 20-28. https://doi.org/10.2307/2346806
Hovy, D., Berg-Kirkpatrick, T., Vaswani, A., and Hovy, E. (2013). Learning Whom to Trust with MACE. Proceedings of NAACL-HLT 2013, 1120-1130. https://aclanthology.org/N13-1132/
Plank, B., Hovy, D., and Søgaard, A. (2014). Linguistically debatable or just plain wrong? Proceedings of ACL 2014 (Volume 2: Short Papers), 507-511. https://doi.org/10.3115/v1/P14-2083
Pavlick, E., and Kwiatkowski, T. (2019). Inherent Disagreements in Human Textual Inferences. Transactions of the Association for Computational Linguistics, 7, 677-694. https://aclanthology.org/Q19-1043/
Bayerl, P. S., and Paul, K. I. (2011). What Determines Inter-Coder Agreement in Manual Annotations? A Meta-Analytic Investigation. Computational Linguistics, 37(4), 699-725. https://doi.org/10.1162/COLI_a_00074
Alfter, D., Lindström Tiedemann, T., and Volodina, E. (2022). Crowdsourcing Relative Rankings of Multi-Word Expressions: Experts versus Non-Experts. Northern European Journal of Language Technology, 7(1). https://doi.org/10.3384/nejlt.2000-1533.2021.3128
Plank, B. (2022). The "Problem" of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation. Proceedings of EMNLP 2022, 10671-10682. https://doi.org/10.18653/v1/2022.emnlp-main.731