Skip to content

Évaluation par grille critériée

Construisez des grilles d'évaluation multicritères dans Potato pour juger des sorties de LLM, corriger des copies, mesurer la qualité de traduction, et toute tâche d'annotation structurée par grille.

Le schéma d'annotation par grille critériée fournit une interface en grille pour noter un contenu sur plusieurs critères, selon une échelle définie. Utilisez-le pour évaluer des sorties de LLM, corriger des copies, apprécier la qualité d'une traduction, ou pour toute tâche demandant une notation structurée sur plusieurs dimensions.

Grille d'évaluation de Potato notant une réponse sur l'exactitude, la pertinence et la fluiditéL'évaluation par grille critériée dans Potato

Vue d'ensemble

Le schéma d'évaluation par grille présente :

  • Une grille de critères, chacun avec sa propre échelle de notation
  • Des libellés d'échelle allant de Médiocre à Excellent (personnalisables)
  • Une note globale facultative qui résume l'ensemble des critères
  • Des descriptions pour chaque critère, qui guident les annotateurs

C'est particulièrement utile pour l'évaluation humaine structurée de sorties d'IA générative.

Démarrage rapide

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: response_quality
    description: Evaluate the quality of this AI-generated response.
    scale_points: 5
    criteria:
      - name: Accuracy
        description: Is the information factually correct?
      - name: Relevance
        description: Does the response address the question?
      - name: Fluency
        description: Is the response well-written and natural?

Options de configuration

ChampTypeDéfautDescription
annotation_typestringObligatoireDoit valoir "rubric_eval"
namestringObligatoireIdentifiant unique de ce schéma
descriptionstringObligatoireConsignes affichées aux annotateurs
scale_pointsinteger5Nombre de points de l'échelle de notation
scale_labelsarray["Poor", "Fair", "Average", "Good", "Excellent"]Libellés de chaque point de l'échelle (la longueur doit correspondre à scale_points)
criteriaarrayObligatoireListe d'objets de critère, chacun avec un name et une description facultative
show_overallbooleanfalseAffiche une ligne de note globale sous les critères

Exemples

Évaluation de sorties de LLM

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: llm_eval
    description: Rate the quality of this model-generated response.
    scale_points: 5
    scale_labels:
      - Poor
      - Fair
      - Average
      - Good
      - Excellent
    show_overall: true
    criteria:
      - name: Helpfulness
        description: Does the response provide useful and actionable information?
      - name: Accuracy
        description: Is the response factually correct and free of hallucinations?
      - name: Harmlessness
        description: Is the response free of harmful, biased, or inappropriate content?
      - name: Coherence
        description: Is the response logically structured and easy to follow?

Correction de copies

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: essay_grade
    description: Grade this student essay using the rubric below.
    scale_points: 4
    scale_labels:
      - Below Expectations
      - Approaching
      - Meets Expectations
      - Exceeds Expectations
    criteria:
      - name: Thesis
        description: Is there a clear and arguable thesis statement?
      - name: Evidence
        description: Does the essay use relevant evidence to support claims?
      - name: Organization
        description: Is the essay logically organized with clear transitions?
      - name: Grammar
        description: Is the writing free of grammatical and spelling errors?

Appréciation de la qualité d'une traduction

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: translation_quality
    description: Evaluate the quality of this machine translation.
    scale_points: 3
    scale_labels:
      - Unacceptable
      - Acceptable
      - Perfect
    criteria:
      - name: Adequacy
        description: Does the translation convey the same meaning as the source?
      - name: Fluency
        description: Does the translation read naturally in the target language?
      - name: Terminology
        description: Are domain-specific terms translated correctly?

Format de sortie

json
{
  "response_quality": {
    "labels": {
      "Accuracy": 4,
      "Relevance": 5,
      "Fluency": 3
    },
    "overall": 4
  }
}

Chaque critère est associé à la valeur d'échelle retenue (numérotée à partir de 1). Le champ overall n'apparaît que si show_overall vaut true.

Bonnes pratiques

  1. Gardez des critères indépendants : chaque critère doit mesurer une dimension distincte, sinon la notation devient redondante
  2. Rédigez des descriptions claires : les annotateurs doivent savoir sans ambiguïté ce que mesure chaque critère
  3. Restez entre 3 et 5 points d'échelle : moins de points allègent la charge cognitive ; au-delà de 7, la fiabilité progresse rarement
  4. Donnez des exemples de référence : dans la description, indiquez ce qui correspond à chaque extrémité de l'échelle
  5. Activez la note globale pour l'agrégation : show_overall est utile quand il vous faut une mesure de synthèse à côté du détail par critère

Pour aller plus loin

Pour les détails d'implémentation, consultez la documentation source.