Scale di valutazione
Come progettare le scale di valutazione per l'annotazione: Likert o slider, quanti punti usare, come evitare il bias di acquiescenza e come costruire task di rating in Potato.
Una scala di valutazione registra il grado, quanto è positivo, quanto è scorrevole, quanto è utile, invece di una categoria. Le due forme più comuni sono la scala Likert discreta (per esempio da 1 a 5) e lo slider continuo. Piccole scelte di progettazione cambiano i dati più di quanto si immagini.
Likert: punti discreti
Usa una scala Likert quando vuoi giudizi confrontabili e facili da aggregare:
annotation_schemes:
- annotation_type: likert
name: fluency
description: "How fluent is this translation?"
size: 5
min_label: "Not fluent at all"
max_label: "Perfectly fluent"Le decisioni che contano:
- Quanti punti? Cinque è un default sicuro. Sette dà più risoluzione, se gli annotatori sanno sfruttarla. Un numero pari toglie il punto centrale neutro e costringe a sbilanciarsi: utile quando «neutro» è una scappatoia, rischioso quando la neutralità è reale.
- Etichetta gli estremi, e possibilmente ogni punto. I punti etichettati vengono interpretati in modo più uniforme dei numeri nudi.
- Tieni la stessa direzione in tutte le tue scale, così gli annotatori non le invertono per abitudine.
Slider: valori continui
Usa uno slider quando la quantità sottostante è davvero continua, come una percentuale di confidenza o l'intensità di un'emozione:
annotation_schemes:
- annotation_type: slider
name: confidence
description: "How confident are you in your label?"
min_value: 0
max_value: 100
step: 1Le scale continue danno risoluzione ma abbassano l'accordo, perché nessuno condivide una percezione così fine della differenza tra 67 e 72. Se ti serve accordo, raggruppa i valori in fasce.
Bias da tenere presenti nel progetto
- Bias di acquiescenza: la tendenza a dire di sì. Inserisci item formulati al contrario, così l'accordo non è la risposta di default. Vedi acquiescence bias.
- Tendenza centrale: l'addensamento sui valori di mezzo. Etichette chiare agli estremi e, dove ha senso, un numero pari di punti la contrastano.
- Ancoraggio: i primi elementi fissano un riferimento. Un breve insieme di calibrazione all'inizio aiuta.
Oltre la singola scala
- Valuta molti elementi sulla stessa scala in una volta con
multirate(per esempio ciascun documento recuperato). Vedi Valutazione dei sistemi RAG. - Assegna punteggi a più criteri pesati con
rubric_eval. Vedi Valutazione di LLM basata su rubriche. - I giudizi sulla qualità audio come il MOS usano lo stesso meccanismo Likert, vedi Annotazione audio.
Approfondimenti
- Scegliere uno schema di annotazione
- Confronto a coppie e best–worst scaling, quando i confronti battono i punteggi
- Accordo tra annotatori