Évaluation par grille critériée
Construisez des grilles d'évaluation multicritères dans Potato pour juger des sorties de LLM, corriger des copies, mesurer la qualité de traduction, et toute tâche d'annotation structurée par grille.
Le schéma d'annotation par grille critériée fournit une interface en grille pour noter un contenu sur plusieurs critères, selon une échelle définie. Utilisez-le pour évaluer des sorties de LLM, corriger des copies, apprécier la qualité d'une traduction, ou pour toute tâche demandant une notation structurée sur plusieurs dimensions.
L'évaluation par grille critériée dans Potato
Vue d'ensemble
Le schéma d'évaluation par grille présente :
- Une grille de critères, chacun avec sa propre échelle de notation
- Des libellés d'échelle allant de Médiocre à Excellent (personnalisables)
- Une note globale facultative qui résume l'ensemble des critères
- Des descriptions pour chaque critère, qui guident les annotateurs
C'est particulièrement utile pour l'évaluation humaine structurée de sorties d'IA générative.
Démarrage rapide
annotation_schemes:
- annotation_type: rubric_eval
name: response_quality
description: Evaluate the quality of this AI-generated response.
scale_points: 5
criteria:
- name: Accuracy
description: Is the information factually correct?
- name: Relevance
description: Does the response address the question?
- name: Fluency
description: Is the response well-written and natural?Options de configuration
| Champ | Type | Défaut | Description |
|---|---|---|---|
annotation_type | string | Obligatoire | Doit valoir "rubric_eval" |
name | string | Obligatoire | Identifiant unique de ce schéma |
description | string | Obligatoire | Consignes affichées aux annotateurs |
scale_points | integer | 5 | Nombre de points de l'échelle de notation |
scale_labels | array | ["Poor", "Fair", "Average", "Good", "Excellent"] | Libellés de chaque point de l'échelle (la longueur doit correspondre à scale_points) |
criteria | array | Obligatoire | Liste d'objets de critère, chacun avec un name et une description facultative |
show_overall | boolean | false | Affiche une ligne de note globale sous les critères |
Exemples
Évaluation de sorties de LLM
annotation_schemes:
- annotation_type: rubric_eval
name: llm_eval
description: Rate the quality of this model-generated response.
scale_points: 5
scale_labels:
- Poor
- Fair
- Average
- Good
- Excellent
show_overall: true
criteria:
- name: Helpfulness
description: Does the response provide useful and actionable information?
- name: Accuracy
description: Is the response factually correct and free of hallucinations?
- name: Harmlessness
description: Is the response free of harmful, biased, or inappropriate content?
- name: Coherence
description: Is the response logically structured and easy to follow?Correction de copies
annotation_schemes:
- annotation_type: rubric_eval
name: essay_grade
description: Grade this student essay using the rubric below.
scale_points: 4
scale_labels:
- Below Expectations
- Approaching
- Meets Expectations
- Exceeds Expectations
criteria:
- name: Thesis
description: Is there a clear and arguable thesis statement?
- name: Evidence
description: Does the essay use relevant evidence to support claims?
- name: Organization
description: Is the essay logically organized with clear transitions?
- name: Grammar
description: Is the writing free of grammatical and spelling errors?Appréciation de la qualité d'une traduction
annotation_schemes:
- annotation_type: rubric_eval
name: translation_quality
description: Evaluate the quality of this machine translation.
scale_points: 3
scale_labels:
- Unacceptable
- Acceptable
- Perfect
criteria:
- name: Adequacy
description: Does the translation convey the same meaning as the source?
- name: Fluency
description: Does the translation read naturally in the target language?
- name: Terminology
description: Are domain-specific terms translated correctly?Format de sortie
{
"response_quality": {
"labels": {
"Accuracy": 4,
"Relevance": 5,
"Fluency": 3
},
"overall": 4
}
}Chaque critère est associé à la valeur d'échelle retenue (numérotée à partir de 1). Le champ overall n'apparaît que si show_overall vaut true.
Bonnes pratiques
- Gardez des critères indépendants : chaque critère doit mesurer une dimension distincte, sinon la notation devient redondante
- Rédigez des descriptions claires : les annotateurs doivent savoir sans ambiguïté ce que mesure chaque critère
- Restez entre 3 et 5 points d'échelle : moins de points allègent la charge cognitive ; au-delà de 7, la fiabilité progresse rarement
- Donnez des exemples de référence : dans la description, indiquez ce qui correspond à chaque extrémité de l'échelle
- Activez la note globale pour l'agrégation :
show_overallest utile quand il vous faut une mesure de synthèse à côté du détail par critère
Pour aller plus loin
- Échelles de Likert : échelles de notation à une seule dimension
- Comparaison par paires : évaluation côte à côte
- Contrôle de la qualité : tests d'attention et étalons de référence
Pour les détails d'implémentation, consultez la documentation source.