Skip to content

評分量表

如何為標註設計評分量表:Likert 與滑塊的對比、應設多少個刻度、如何規避默許偏差,以及如何在 Potato 中搭建評分任務。

評分量表捕捉的是程度——有多正面、多流暢、多有用——而非某個類別。常見的兩種形式是離散的 Likert 量表(例如 1–5)和連續的滑塊 量表上一些看似微小的設計選擇,對資料的影響往往超出人們的預期。

Likert:離散刻度

當你希望得到便於比較、易於彙總的評分時,使用 Likert 量表:

yaml
annotation_schemes:
  - annotation_type: likert
    name: fluency
    description: "How fluent is this translation?"
    size: 5
    min_label: "Not fluent at all"
    max_label: "Perfectly fluent"

需要權衡的設計決策:

  • 用多少個刻度? 五個是穩妥的預設值。若標註者用得上,七個能提供更高的解析度。偶數刻度去掉了中間的中立選項,迫使標註者表態——當"中立"淪為敷衍時很有用,但當中立確實存在時則有風險。
  • 標註兩端,最好每個刻度都標註。 帶標籤的刻度比單純的數字解讀得更一致。
  • 保持方向一致,讓所有量表的方向統一,標註者就不會因習慣而把它們弄反。

滑塊:連續取值

當底層數量確實是連續的時——比如置信度百分比或情緒強度——使用 slider

yaml
annotation_schemes:
  - annotation_type: slider
    name: confidence
    description: "How confident are you in your label?"
    min_value: 0
    max_value: 100
    step: 1

連續量表帶來更高的解析度,但一致性更低,因為人們對"67 還是 72"並沒有共通的細粒度判斷。如果你需要一致性,就把輸出分箱。

需要在設計上規避的偏差

  • 默許偏差:傾向於表示同意。穿插一些反向措辭的題目,讓"同意"不再是預設答案。參見默許偏差
  • 集中趨勢:扎堆選中間。清晰的端點標籤,以及在合適時採用偶數刻度,都能抵消這一傾向。
  • 錨定效應:開頭的幾個條目會設定一個參照點。在開始處放一小組校準題會有幫助。

超越單一量表

  • multirate 在同一量表上一次性給多個條目評分(例如每篇檢索到的文件)。參見 RAG 評估
  • rubric_eval 對多項加權標準打分。參見基於評分表的 LLM 評估
  • 音訊品質評分,如 MOS,採用的就是同一套 Likert 機制,參見音訊標註

延伸閱讀