Skip to content

基於評分量表的 LLM 評估

如何使用 Potato 的 rubric 評估類型,依據多項加權標準(MT-Bench 風格)評估 LLM 的輸出。

評分量表把籠統的判斷("這是個好答案嗎?")拆解成具體、可打分的標準——有用性、準確性、完整性、語氣、安全性——每一項都按某個量表評分。它讓 LLM 評估變得可復現,並揭示一個答案為什麼優於另一個。 這正是 MT-Bench 這類基準背後的結構。

評分量表(rubric)把主觀的品質轉化為一張由明確標準和量表刻度構成的網格,從而提高一致性,並使結果更易解讀。

何時使用評分量表

  • 輸出足夠豐富,以致單一分數會丟失資訊。
  • 你需要知道哪一個維度薄弱(準確性還是語氣),而不只是一個總體結論。
  • 你希望各方在評分前就標準達成一致。

如果你只需要判斷"哪個更好",那麼成對比較的成本更低。當你需要一份絕對的、多維度的畫像時,評分量表才更合適。

在 Potato 中進行設定

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: answer_quality
    description: "Rate the answer on each criterion."
    scale_points: 5
    criteria:
      - {name: Helpfulness, description: "Does it address the user's actual need?"}
      - {name: Accuracy,    description: "Is it factually correct?"}
      - {name: Completeness, description: "Does it cover the important points?"}
      - {name: Tone,        description: "Is the style appropriate?"}

Potato 會把它渲染成一張網格:標準沿一側排列,量表刻度橫向排列。標註者為每個單元格打分。

撰寫優質的標準

  • 讓標準彼此獨立。 相互重疊的標準("有幫助"和"有用")會被一起打分,徒增噪聲。
  • 為量表設定錨點。 為每一項標準描述 1 分和 5 分各是什麼樣子,而不只是整體上的兩端。
  • 保持簡短。 四到六項標準通常是最佳範圍;冗長的量表會讓標註者疲勞,並降低一致性。

評分量表與 LLM 充當裁判

你交給人工的同一份評分量表,也可以用來提示一個"LLM 裁判"做廉價的預打分,再讓人工核驗——與 LLM 預標註中的做法完全一致。保留一份人工打分的樣本來檢驗裁判,並留意裁判自身的偏差(長度、格式、自我偏好)。

延伸閱讀