Truth Serum
意外に多い(surprisingly popular)スコアリングをアノテーションに持ち込みます。ラベルごとに小さな質問を1つ足すだけで、難しいアイテムで多数決を上回れます。ゴールドラベルはどこにも要りません。
v2.7.0の新機能
多数決は、アノテーションが難しいまさにその場所で失敗します。自信を持った多数派が誤っていて、事情を知る少数派が正しいときです。Truth Serumは、各ラベルのあとに小さな質問を1つ追加します。
あなたは Sarcastic を選びました。他のアノテーターのうち何パーセントが、あなたと同じラベルを選ぶと思いますか?

スライダー1つ、クリック1回です。この予測が意外に多い(surprisingly popular)という原理を動かします(Prelec 2004、Prelec, Seung & McCoy 2017、Nature)。実際の得票率が予測された得票率を最も上回ったラベルが、そのとき手に入る最良の真値の推定であり、その計算にゴールドラベルは要りません。
直観としては、正しい少数意見を持つ人はたいてい自分が少数派だと分かっているので、その答えは誰の予測よりも多く支持される、ということです。
私たちの知る限り、ピア予測によるスコアリングを搭載したアノテーションツールはPotatoが初めてです。
得られるもの
- 難しいアイテムで多数決を上回るアイテム判定。 ダッシュボードの「多数派が誤っていそうなところ」キューには、意外に多いラベルが多数派ラベルと食い違うインスタンスがすべて並びます。ここから先に見直すか、裁定に回してください。
- アノテーターのキャリブレーションスコア。 各アノテーターが予測した一致率と、実際に他の人から得られた一致率のずれです。自信過剰でキャリブレーションのずれたアノテーターが、ゴールド問題なしで浮かび上がります。
- SPアラインメント。 各アノテーターのラベルが、意外に多いという判定とどれだけ一致するか。単に周りに合わせているのではなく、事情を知っていることの代理指標になります。
設定
yaml
truth_serum:
enabled: true
schema: sarcasm # scheme to collect predictions for (default: first radio)
min_annotators: 3 # predictions per item before a verdict is computed
# question: "What percentage of other annotators will choose the same label as you?"| オプション | デフォルト | 説明 |
|---|---|---|
enabled | false | 全体のスイッチ。 |
schema | 最初のradioスキーマ | どのスキーマのラベルに得票率の予測を付けるか。 |
question | 上記参照 | スライダーの上に表示される問い。 |
min_annotators | 3 | 判定を計算する前に必要な、アイテムあたりの最小予測数(下限は2)。 |
手法に関するメモ
Truth Serumを論文で引用する前に、以下に目を通してください。
- これは自分の回答についての予測を使う簡略版です。各アノテーターは、全ラベルにわたる分布ではなく、自分が選んだラベルの得票率を予測します。あるラベルの予測得票率はそれを選んだ人の予測の平均であり、そのサプライズは
実際の% − 予測の%、SP判定は最もサプライズの大きい得票ラベルです。 - 判定が計算されるのは予測が
min_annotators件以上あるときだけです。Nが小さい判定はノイズが多く、3は推奨値ではなく下限で、5件以上あるほうが望ましいです。 - キャリブレーション誤差は、各予測を、そのアイテムに対する他のアノテーターの一致率(本人は除く)と比べます。
- アノテーターは修正できます。インスタンスごとに最新の (ラベル, 予測) の組が採用されます。
データとAPI
予測は {output_annotation_dir}/truth_serum/predictions.jsonl に保存されます(追記のみ。アノテーターとインスタンスの組ごとに最新のレコードが採用されます)。
| エンドポイント | メソッド | 認証 | 目的 |
|---|---|---|---|
/truth_serum/api/predict | POST | セッション | ラベルと予測%を記録 |
/truth_serum/api/mine | GET | セッション | このアノテーターの予測(ウィジェットの復元用) |
/truth_serum/dashboard | GET | 管理者 | 判定とキャリブレーションのダッシュボード |
/truth_serum/api/stats | GET | 管理者 | ダッシュボードの集計値 |
/truth_serum/api/export | GET | 管理者 | JSONでの全件エクスポート(判定 + 生の予測) |
参考資料
- 心理測定 — 事後確率と信頼区間つきのラベル
- Boundary Lab — 反実仮想プローブによる品質管理
- MACE — 能力の推定。Truth Serumのキャリブレーションの見方と組み合わせられます
- クラウドラベルの集約
- ソースドキュメント