Individuare le allucinazioni con l'annotazione di span
Come trovare ed etichettare allucinazioni ed errori fattuali nell'output di un modello con l'annotazione di span e la marcatura degli errori in stile MQM in Potato.
Un'allucinazione è un'affermazione che il modello fa con sicurezza ma che non è supportata dal suo input né dai fatti. Il modo più utile per registrarla è evidenziare le parole esatte ed etichettare cosa non va, cioè un task di annotazione di span sull'output del modello. Le etichette a livello di span sono molto più utili di un unico flag «questa risposta è sbagliata».
Per il contesto, vedi hallucination (artificial intelligence).
Perché marcare gli span invece delle risposte intere
Un'etichetta «infedele» sull'intera risposta dice che qualcosa non va; uno span dice cosa e dove. Con i dati a livello di span puoi misurare i tassi di errore per tipo, individuare ricorrenze e costruire dati di addestramento mirati. È lo stesso approccio di MQM (Multidimensional Quality Metrics), il framework di riferimento per gli span di errore nella valutazione della traduzione automatica.
Impostare l'annotazione degli span di errore
annotation_schemes:
- annotation_type: span
name: errors
description: "Highlight each problematic span and label the error type."
labels: [unsupported_claim, factual_error, contradiction, fabricated_citation]
- annotation_type: radio
name: severity
description: "How serious is the worst error?"
labels: [Minor, Major, Critical]Aggiungi un giudizio di gravità, così puoi pesare una svista banale in modo diverso da una fabbricazione pericolosa, come fa MQM.
Definire i tipi di errore
- Unsupported claim: non trova sostegno nella fonte (il caso RAG).
- Factual error: contraddice un fatto accertato.
- Contradiction: è in conflitto con qualcosa detto prima nello stesso output.
- Fabricated citation: un riferimento che non esiste o che non dice quello che gli viene attribuito.
Tieni l'insieme piccolo e dai a ciascun tipo una definizione di una riga con un esempio, come spiegato in Scrivere le linee guida di annotazione.
Due dataset pubblici fanno esattamente questo: FAVA marca span di allucinazione a grana fine nel testo generato, e SHROOM è uno shared task sugli errori di sovragenerazione.
Aspetti di qualità
- Dai agli annotatori il materiale di partenza; senza, «non supportato» non è definibile.
- Le regole sui confini contano: lo span copre l'intera frase o solo la proposizione falsa? Decidilo una volta per tutte.
- La fedeltà ai fatti nei casi limite resta soggettiva; raccogli sovrapposizione e monitora l'accordo.