評分量表
如何為標註設計評分量表:Likert 與滑塊的對比、應設多少個刻度、如何規避默許偏差,以及如何在 Potato 中搭建評分任務。
評分量表捕捉的是程度——有多正面、多流暢、多有用——而非某個類別。常見的兩種形式是離散的 Likert 量表(例如 1–5)和連續的滑塊。 量表上一些看似微小的設計選擇,對資料的影響往往超出人們的預期。
Likert:離散刻度
當你希望得到便於比較、易於彙總的評分時,使用 Likert 量表:
yaml
annotation_schemes:
- annotation_type: likert
name: fluency
description: "How fluent is this translation?"
size: 5
min_label: "Not fluent at all"
max_label: "Perfectly fluent"需要權衡的設計決策:
- 用多少個刻度? 五個是穩妥的預設值。若標註者用得上,七個能提供更高的解析度。偶數刻度去掉了中間的中立選項,迫使標註者表態——當"中立"淪為敷衍時很有用,但當中立確實存在時則有風險。
- 標註兩端,最好每個刻度都標註。 帶標籤的刻度比單純的數字解讀得更一致。
- 保持方向一致,讓所有量表的方向統一,標註者就不會因習慣而把它們弄反。
滑塊:連續取值
當底層數量確實是連續的時——比如置信度百分比或情緒強度——使用 slider:
yaml
annotation_schemes:
- annotation_type: slider
name: confidence
description: "How confident are you in your label?"
min_value: 0
max_value: 100
step: 1連續量表帶來更高的解析度,但一致性更低,因為人們對"67 還是 72"並沒有共通的細粒度判斷。如果你需要一致性,就把輸出分箱。
需要在設計上規避的偏差
- 默許偏差:傾向於表示同意。穿插一些反向措辭的題目,讓"同意"不再是預設答案。參見默許偏差。
- 集中趨勢:扎堆選中間。清晰的端點標籤,以及在合適時採用偶數刻度,都能抵消這一傾向。
- 錨定效應:開頭的幾個條目會設定一個參照點。在開始處放一小組校準題會有幫助。
超越單一量表
- 用
multirate在同一量表上一次性給多個條目評分(例如每篇檢索到的文件)。參見 RAG 評估。 - 用
rubric_eval對多項加權標準打分。參見基於評分表的 LLM 評估。 - 音訊品質評分,如 MOS,採用的就是同一套 Likert 機制,參見音訊標註。
延伸閱讀
- 選擇標註方案
- 成對比較與最優最劣標度,當比較優於評分時
- 標註者間一致性詳解