Skip to content

専門家アノテーションとクラウドアノテーション

クラウドの作業者が専門家に並ぶのはどんなときか、項目あたり何人必要か、それぞれの費用はいくらか、多数決に頼らずアノテーターの能力をモデル化する方法。

ガイドラインを丁寧に追った非専門家が専門家と同じ判断に至るタスクでは、クラウドの作業者を使い、項目あたり一つではなく複数の判断を集める。Snow et al. (2008) は、五つの自然言語タスクにわたって、平均四人の非専門家のアノテーションが専門家一人分の一致度に匹敵することを示した。

専門家とクラウドの選択は、たいてい品質と費用のトレードオフとして語られるが、多くのタスクではそれが誤った枠組みだ。問うべきは、その判断がクラウドの持たない訓練に依存するかどうかである。感情、含意関係、単語の類似度はおおむね依存しない。臨床コーディング、法務分類、音声表記はおおむね依存する。

証拠が支えていること

基礎となる結果は Snow et al. (2008) による。彼らは Amazon Mechanical Turk の非専門家アノテーションを、感情認識、単語類似度、含意関係認識、事象の時間順序付け、語義曖昧性解消の各タスクで専門家のゴールドスタンダードと比較した。タスクをまとめた結果として、「専門家アノテーター一人と同等の ITA を達成するのに必要な非専門家アノテーションは、例あたり 4 件だけである」("it requires only 4 non-expert annotations per example to achieve the equivalent ITA as a single expert annotator") と報告している。費用については比率ではなく単価を示し、感情アノテーション 7,000 件を 2 ドルで集め、それを「1 USD あたり少なくとも 875 件の専門家相当ラベル」("at least 875 expert-equivalent labels per USD") と述べている。

その平均の内側にあるタスクごとのばらつきは、平均そのものより重要だ。感情タスクでは、怒り・嫌悪・悲しみは非専門家二人で専門家水準に達し、驚きは九人を要し、恐れは集めた十人の範囲では一度も達しなかった。タスク単位の平均は、クラウドが訓練の代わりにならないラベルを覆い隠す。

Callison-Burch (2009) は機械翻訳評価で同じ傾向を見いだし、WMT08 の判断を 10 ドルで再現したうえで、非専門家の判断を統合したものは「Bleu よりも専門家の判断と強く相関する」("correlate more strongly with expert judgments than Bleu does") と報告している。

反対側の重しは、専門家のほうが速い場合があることだ。Alfter et al. (2022) は、第二言語話者、言語の専門職、CEFR の専門家を対象に、複合語表現の best-worst scaling タスクを実施した。三群の順位付けは高く相関し品質は同等だったが、専門家による直接アノテーションはプロジェクトあたり 15 分から 90 分だったのに対し、クラウド版はおよそ 8 時間から 9 時間かかり、彼らはこれを「少なくとも五倍速い」("at least five times as fast") と述べている。少数の専門家がすでに確保できている場面では、作業をクラウドに回すと節約した以上の時間を失いかねない。

効いているのは冗長性であってクラウドではない

上記のどの研究でも、クラウドの判断一つは専門家の判断一つより劣る。差を埋めるのは、項目あたり複数の判断を集めて統合することであり、したがって設計上の問いは、どう統合するかになる。

多数決はすべてのアノテーターを等しく信頼できるものとして扱うが、実際には等しくない。これに対し、信頼度をデータから推定するモデルが二つある。Dawid and Skene (1979) は、観測者ごとの混同行列と潜在的な真のラベルを同時に推定する EM 法の手続きを、もともと臨床観測者の誤りのために導入した。MACE、すなわち Multi-Annotator Competence Estimation は、クラウドソーシングの場面のために作られた項目反応モデルで、どのアノテーターが信頼できるかを教師なしで学習し、背後にあるラベルを予測する。著者たちがこれを作ったのは、「一部のアノテーターは報酬を最大化するために悪いラベルを選ぶ」("some annotators choose bad labels in order to maximize their pay") からであり、この故障モードは、十分な人数が同じことをすると多数決が黙って取り込んでしまう。

Potato は両方を備えている。mace ブロックは収集済みのアノテーションに対して能力推定を実行し、Dawid-Skene 計算ツールは貼り付けたラベルに推定器を適用する。

yaml
mace:
  enabled: true
 
num_annotators_per_item: 4
 
gold_standards:
  enabled: true
 
attention_checks:
  enabled: true

num_annotators_per_item: 4 は自社の既定値ではなく Snow et al. の知見に従ったもので、プロジェクト間で持ち回すのではなく、タスクごとに見直すべき値である。ゴールドスタンダードと注意力チェックは、読んでいないアノテーターを捕まえる。能力モデルは、較正の足場となる項目がいくつかあるほうがうまく働く。

不一致は自動的に誤りではない

あらゆる不一致を品質問題として扱うと、打つ手を間違える。Plank et al. (2014) は品詞アノテーションにおけるアノテーター間の不一致を分析し、「言語学的に動機づけられないアノテーターの選択は 2% にすぎない」("only 2% of annotator choices are linguistically unmotivated") ことを見いだして、不一致の大半は誤りではなく言語学的に議論の余地のある事例から生じると結論づけた。

Pavlick and Kwiatkowski (2019) は、自然言語推論における不一致がデータを増やせば消えるかを検証したが、消えなかった。彼らは、不一致は「アノテーションの『ノイズ』として片付けられるものではなく、評価を多く集めても、評価者に与える文脈量を変えても残り続ける」("are not dismissible as annotation 'noise', but rather persist as we collect more ratings and as we vary the amount of context provided to raters") と報告している。Plank (2022) はこの点を人間のラベル変動として一般化している。

実務的な検査は安上がりだ。アノテーターの意見が割れた項目について、判断をさらに集める。一致度が収束すれば、その不一致はノイズであり、冗長性で解消する。横ばいのままなら、その項目は本当に曖昧であり、単一のラベルを強いるのではなく分布を記録するのが正しい対応になる。

一致度は、アノテーターの種類よりも訓練で変わる

Bayerl and Paul (2011) は、語義曖昧性解消、韻律表記、音声表記にわたる 96 件のアノテーション研究をメタ分析し、346 個の一致度指標を対象とした。一致度のばらつきを説明した要因は七つで、そのうち二つが訓練に関わる。すなわち、アノテーターが訓練を受けたかどうかと、それがどれだけ集中的だったかである。残りは、アノテーションの領域、スキーマのカテゴリ数、アノテーターの人数、アノテーションの目的、そして一致率の計算方法である。

この結果は、専門家かクラウドかという判断の立て方を変える。カテゴリ数の少ない、検証済みのスキーマで作業する訓練されたクラウドのアノテーターは、曖昧なスキーマで作業する訓練されていない専門家よりも高い一致度を示すことが多い。一致度に対しては、募集経路よりもアノテーションガイドラインの書き方とアノテーションスキーマの選び方のほうが効く。

クラウドアノテーションが立ち行かない場面

クラウドが誤った選択になる条件は三つある。臨床や法務のコーディングのように、判断に資格を伴う知識が必要で、ラベルの誤りが単なるノイズでは済まない場合。データを自分たちのインフラの外に出せず、品質にかかわらず公開マーケットプレイスが除外される場合。ラベル集合が大きいか階層的で、アノテーター一人あたりの訓練費用が節約分を上回る場合。三つ目は、おおよそ数十カテゴリを超えると多く起きる。

一つ目の条件が当てはまるのに分量が多いときは、たいてい混合設計がどちらの極よりも優れる。専門家が部分集合にラベルを付け、その部分集合をゴールドスタンダードとし、クラウドのアノテーターは本番のタスクに進む前にそれで選別される。選別の仕組みはゴールドスタンダードと注意力チェックで扱っている。

さらに読む

参考文献

Snow, R., O'Connor, B., Jurafsky, D., and Ng, A. Y. (2008). Cheap and Fast – But is it Good? Evaluating Non-Expert Annotations for Natural Language Tasks. Proceedings of EMNLP 2008, 254-263. https://aclanthology.org/D08-1027/

Callison-Burch, C. (2009). Fast, Cheap, and Creative: Evaluating Translation Quality Using Amazon's Mechanical Turk. Proceedings of EMNLP 2009, 286-295. https://aclanthology.org/D09-1030/

Dawid, A. P., and Skene, A. M. (1979). Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm. Journal of the Royal Statistical Society. Series C (Applied Statistics), 28(1), 20-28. https://doi.org/10.2307/2346806

Hovy, D., Berg-Kirkpatrick, T., Vaswani, A., and Hovy, E. (2013). Learning Whom to Trust with MACE. Proceedings of NAACL-HLT 2013, 1120-1130. https://aclanthology.org/N13-1132/

Plank, B., Hovy, D., and Søgaard, A. (2014). Linguistically debatable or just plain wrong? Proceedings of ACL 2014 (Volume 2: Short Papers), 507-511. https://doi.org/10.3115/v1/P14-2083

Pavlick, E., and Kwiatkowski, T. (2019). Inherent Disagreements in Human Textual Inferences. Transactions of the Association for Computational Linguistics, 7, 677-694. https://aclanthology.org/Q19-1043/

Bayerl, P. S., and Paul, K. I. (2011). What Determines Inter-Coder Agreement in Manual Annotations? A Meta-Analytic Investigation. Computational Linguistics, 37(4), 699-725. https://doi.org/10.1162/COLI_a_00074

Alfter, D., Lindström Tiedemann, T., and Volodina, E. (2022). Crowdsourcing Relative Rankings of Multi-Word Expressions: Experts versus Non-Experts. Northern European Journal of Language Technology, 7(1). https://doi.org/10.3384/nejlt.2000-1533.2021.3128

Plank, B. (2022). The "Problem" of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation. Proceedings of EMNLP 2022, 10671-10682. https://doi.org/10.18653/v1/2022.emnlp-main.731