Valutazione dei sistemi RAG
Come valutare la retrieval-augmented generation con l'annotazione umana: rilevanza dei documenti recuperati, fedeltà della risposta e span di citazione, usando Potato.
La retrieval-augmented generation (RAG) risponde a una domanda recuperando prima dei documenti e generando poi una risposta a partire da quelli. Valutare un sistema RAG vuol dire giudicare due cose separatamente: ha recuperato i documenti giusti, e la risposta è davvero sostenuta da quei documenti? Mescolare le due cose nasconde il punto in cui il sistema fallisce.
Per un inquadramento, vedi retrieval-augmented generation.
Le tre cose da annotare
- Rilevanza del recupero: per ogni documento recuperato, è pertinente alla query?
- Fedeltà della risposta: la risposta generata è ancorata ai documenti recuperati, senza affermazioni non supportate?
- Accuratezza delle citazioni: le affermazioni della risposta risalgono davvero alle fonti citate?
Come configurarlo in Potato
Metti tre schemi sulla stessa schermata: valuta ogni documento, valuta la fedeltà ed evidenzia gli span problematici nella risposta.
annotation_schemes:
- annotation_type: multirate
name: retrieval_relevance
description: "Rate the relevance of each retrieved document to the query."
labels: ["Irrelevant", "Somewhat", "Relevant", "Highly relevant"]
- annotation_type: likert
name: faithfulness
description: "Is the answer faithful to the retrieved documents?"
size: 5
min_label: "Many unsupported claims"
max_label: "Fully grounded"
- annotation_type: span
name: problems
description: "Highlight any unsupported or incorrect claim in the answer."
labels: [unsupported_claim, contradicted, hallucination]multirate valuta molti documenti sulla stessa scala in una volta sola; lo schema a span segna esattamente dove la risposta si allontana dalle sue fonti. Vedi Individuare le allucinazioni.
Perché tenere distinti recupero e generazione
Un sistema RAG può sbagliare in due modi: ha recuperato un contesto cattivo (problema di recupero) oppure ha ignorato un contesto buono (problema di generazione). Valutarli separatamente ti dice quale delle due metà sistemare. Un solo punteggio di fedeltà non può farlo.
Aspetti di qualità
- Mostra agli annotatori la query, i documenti e la risposta insieme: senza le fonti la fedeltà non è giudicabile.
- «Pertinente» va definito: pertinente alla query, o effettivamente usato nella risposta? Decidilo in partenza.
- Monitora l'accordo sulla fedeltà, che delle tre è la dimensione più soggettiva.