Skip to content

Valutazione di LLM basata su rubriche

Come valutare gli output di un LLM rispetto a più criteri pesati, in stile MT-Bench, usando il tipo di valutazione a rubrica di Potato.

Una rubrica scompone un giudizio vago («è una buona risposta?») in criteri specifici da valutare, utilità, accuratezza, completezza, tono, sicurezza, ciascuno con il suo punteggio su una scala. Rende ripetibile la valutazione di un LLM e mostra perché una risposta batte l'altra. È la struttura dietro benchmark come MT-Bench.

Una rubrica trasforma una qualità soggettiva in una griglia di criteri definiti e punti di scala, il che alza l'accordo e rende i risultati interpretabili.

Quando usare una rubrica

  • L'output è abbastanza ricco da far perdere informazione a un punteggio unico.
  • Ti serve sapere quale dimensione è debole (accuratezza o tono), non solo un verdetto complessivo.
  • Vuoi criteri su cui gli stakeholder si accordino in partenza.

Se ti basta sapere quale delle due è migliore, un confronto a coppie costa meno. Le rubriche danno il meglio quando ti serve un profilo assoluto e multidimensionale.

Come configurarlo in Potato

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: answer_quality
    description: "Rate the answer on each criterion."
    scale_points: 5
    criteria:
      - {name: Helpfulness, description: "Does it address the user's actual need?"}
      - {name: Accuracy,    description: "Is it factually correct?"}
      - {name: Completeness, description: "Does it cover the important points?"}
      - {name: Tone,        description: "Is the style appropriate?"}

Potato lo mostra come una griglia: i criteri sul lato, i punti della scala in orizzontale. Gli annotatori riempiono ogni cella.

Scrivere criteri validi

  • Rendili indipendenti. Criteri che si sovrappongono («utile» e «di aiuto») vengono valutati insieme e aggiungono solo rumore.
  • Ancora la scala. Descrivi che aspetto hanno un 1 e un 5 per ciascun criterio, non solo gli estremi in generale.
  • Tienila corta. Da quattro a sei criteri è di solito il punto giusto; le rubriche lunghe stancano gli annotatori e abbassano l'accordo.

Rubriche e LLM come giudice

La stessa rubrica che dai agli umani può essere usata come prompt per un «giudice LLM» che fa un primo passaggio di punteggi a basso costo, con verifica umana successiva, esattamente come nella pre-annotazione con LLM. Tieni da parte un campione valutato dagli umani per controllare il giudice, e sorveglia i bias del giudice stesso (lunghezza, formattazione, preferenza per i propri output).

Approfondimenti