Skip to content

Rubrik-Evaluierung

Bewertungsraster mit mehreren Kriterien in Potato bauen, für die Beurteilung von LLM-Ausgaben, Aufsatzbewertung, Übersetzungsqualität und andere rubrikbasierte Annotationsaufgaben.

Das Annotationsschema Rubric Evaluation bietet ein strukturiertes Raster, um Inhalte anhand mehrerer Kriterien auf einer festgelegten Skala zu bewerten. Es eignet sich für die Evaluierung von LLM-Ausgaben, die Bewertung von Aufsätzen, die Beurteilung von Übersetzungsqualität und alle Aufgaben, die eine strukturierte Bewertung über mehrere Dimensionen brauchen.

Rubrik-Raster in Potato, in dem eine Antwort nach Korrektheit, Relevanz und Sprachfluss bewertet wirdRubric evaluation in Potato

Überblick

Das Schema zeigt:

  • ein Raster aus Kriterien, jedes mit eigener Bewertungsskala
  • Skalenbezeichnungen von mangelhaft bis ausgezeichnet (anpassbar)
  • eine optionale Gesamtbewertung, die über die Kriterien hinweg zusammenfasst
  • Beschreibungen je Kriterium als Orientierung für die Annotatoren

Besonders nützlich ist das für die strukturierte menschliche Bewertung von Ausgaben generativer KI.

Schnellstart

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: response_quality
    description: Evaluate the quality of this AI-generated response.
    scale_points: 5
    criteria:
      - name: Accuracy
        description: Is the information factually correct?
      - name: Relevance
        description: Does the response address the question?
      - name: Fluency
        description: Is the response well-written and natural?

Konfigurationsoptionen

FeldTypStandardBeschreibung
annotation_typestringPflichtMuss "rubric_eval" sein
namestringPflichtEindeutige Kennung dieses Schemas
descriptionstringPflichtAnweisungen, die den Annotatoren angezeigt werden
scale_pointsinteger5Zahl der Stufen auf der Bewertungsskala
scale_labelsarray["Poor", "Fair", "Average", "Good", "Excellent"]Bezeichnungen der einzelnen Stufen (Länge muss zu scale_points passen)
criteriaarrayPflichtListe von Kriterien-Objekten, jeweils mit name und optionaler description
show_overallbooleanfalseUnter den Kriterien eine zusätzliche Zeile für die Gesamtbewertung anzeigen

Beispiele

Evaluierung von LLM-Ausgaben

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: llm_eval
    description: Rate the quality of this model-generated response.
    scale_points: 5
    scale_labels:
      - Poor
      - Fair
      - Average
      - Good
      - Excellent
    show_overall: true
    criteria:
      - name: Helpfulness
        description: Does the response provide useful and actionable information?
      - name: Accuracy
        description: Is the response factually correct and free of hallucinations?
      - name: Harmlessness
        description: Is the response free of harmful, biased, or inappropriate content?
      - name: Coherence
        description: Is the response logically structured and easy to follow?

Aufsatzbewertung

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: essay_grade
    description: Grade this student essay using the rubric below.
    scale_points: 4
    scale_labels:
      - Below Expectations
      - Approaching
      - Meets Expectations
      - Exceeds Expectations
    criteria:
      - name: Thesis
        description: Is there a clear and arguable thesis statement?
      - name: Evidence
        description: Does the essay use relevant evidence to support claims?
      - name: Organization
        description: Is the essay logically organized with clear transitions?
      - name: Grammar
        description: Is the writing free of grammatical and spelling errors?

Beurteilung von Übersetzungsqualität

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: translation_quality
    description: Evaluate the quality of this machine translation.
    scale_points: 3
    scale_labels:
      - Unacceptable
      - Acceptable
      - Perfect
    criteria:
      - name: Adequacy
        description: Does the translation convey the same meaning as the source?
      - name: Fluency
        description: Does the translation read naturally in the target language?
      - name: Terminology
        description: Are domain-specific terms translated correctly?

Ausgabeformat

json
{
  "response_quality": {
    "labels": {
      "Accuracy": 4,
      "Relevance": 5,
      "Fluency": 3
    },
    "overall": 4
  }
}

Jedes Kriterium wird auf den gewählten Skalenwert abgebildet (beginnend bei 1). Das Feld overall erscheint nur, wenn show_overall auf true steht.

Praxistipps

  1. Kriterien unabhängig halten – jedes Kriterium sollte eine eigene Dimension messen, sonst wird dieselbe Sache doppelt bewertet
  2. Beschreibungen klar formulieren – Annotatoren müssen ohne Rätselraten wissen, was ein Kriterium misst
  3. 3 bis 5 Skalenstufen verwenden – wenige Stufen senken die kognitive Last, mehr als sieben verbessern die Reliabilität kaum noch
  4. Ankerbeispiele angeben – in der Beschreibung erwähnen, was jeweils das obere und das untere Ende der Skala ausmacht
  5. Gesamtbewertung für die Aggregation aktivierenshow_overall hilft, wenn neben der Aufschlüsselung eine einzelne Kennzahl gebraucht wird

Weiterführende Informationen

Implementierungsdetails stehen in der Quelldokumentation.