Skip to content

Evaluación por Rúbrica

Crea cuadrículas de evaluación con varios criterios en Potato para valorar salidas de LLM, corregir redacciones, medir calidad de traducción y cualquier tarea de anotación estructurada por rúbrica.

El esquema de anotación de evaluación por rúbrica ofrece una cuadrícula estructurada para puntuar contenido según varios criterios en una escala definida. Sirve para evaluar salidas de LLM, corregir redacciones, valorar la calidad de una traducción o cualquier tarea que necesite una puntuación estructurada en varias dimensiones.

Potato rubric evaluation grid scoring a response on accuracy, relevance, and fluencyRubric evaluation in Potato

Visión General

El esquema de evaluación por rúbrica presenta:

  • Una cuadrícula de criterios, cada uno con su propia escala de valoración
  • Etiquetas de escala que van de Deficiente a Excelente (personalizables)
  • Puntuación global opcional que resume el conjunto de criterios
  • Descripciones de cada criterio para orientar a los anotadores

Resulta especialmente útil para la evaluación humana estructurada de salidas de IA generativa.

Inicio Rápido

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: response_quality
    description: Evaluate the quality of this AI-generated response.
    scale_points: 5
    criteria:
      - name: Accuracy
        description: Is the information factually correct?
      - name: Relevance
        description: Does the response address the question?
      - name: Fluency
        description: Is the response well-written and natural?

Opciones de Configuración

CampoTipoPredeterminadoDescripción
annotation_typestringRequeridoDebe ser "rubric_eval"
namestringRequeridoIdentificador único para este esquema
descriptionstringRequeridoInstrucciones mostradas a los anotadores
scale_pointsinteger5Número de puntos de la escala de valoración
scale_labelsarray["Poor", "Fair", "Average", "Good", "Excellent"]Etiquetas de cada punto de la escala (su longitud debe coincidir con scale_points)
criteriaarrayRequeridoLista de objetos de criterio, cada uno con name y description opcional
show_overallbooleanfalseMuestra una fila adicional de puntuación global debajo de los criterios

Ejemplos

Evaluación de Salidas de LLM

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: llm_eval
    description: Rate the quality of this model-generated response.
    scale_points: 5
    scale_labels:
      - Poor
      - Fair
      - Average
      - Good
      - Excellent
    show_overall: true
    criteria:
      - name: Helpfulness
        description: Does the response provide useful and actionable information?
      - name: Accuracy
        description: Is the response factually correct and free of hallucinations?
      - name: Harmlessness
        description: Is the response free of harmful, biased, or inappropriate content?
      - name: Coherence
        description: Is the response logically structured and easy to follow?

Corrección de Redacciones

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: essay_grade
    description: Grade this student essay using the rubric below.
    scale_points: 4
    scale_labels:
      - Below Expectations
      - Approaching
      - Meets Expectations
      - Exceeds Expectations
    criteria:
      - name: Thesis
        description: Is there a clear and arguable thesis statement?
      - name: Evidence
        description: Does the essay use relevant evidence to support claims?
      - name: Organization
        description: Is the essay logically organized with clear transitions?
      - name: Grammar
        description: Is the writing free of grammatical and spelling errors?

Valoración de la Calidad de Traducción

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: translation_quality
    description: Evaluate the quality of this machine translation.
    scale_points: 3
    scale_labels:
      - Unacceptable
      - Acceptable
      - Perfect
    criteria:
      - name: Adequacy
        description: Does the translation convey the same meaning as the source?
      - name: Fluency
        description: Does the translation read naturally in the target language?
      - name: Terminology
        description: Are domain-specific terms translated correctly?

Formato de Salida

json
{
  "response_quality": {
    "labels": {
      "Accuracy": 4,
      "Relevance": 5,
      "Fluency": 3
    },
    "overall": 4
  }
}

Cada criterio se asocia al valor de escala elegido (empezando en 1). El campo overall solo aparece cuando show_overall está en true.

Mejores Prácticas

  1. Mantén los criterios independientes - cada criterio debe medir una dimensión distinta para no puntuar dos veces lo mismo
  2. Escribe descripciones claras - los anotadores deben saber sin ambigüedad qué mide cada criterio
  3. Usa entre 3 y 5 puntos de escala - menos puntos reducen la carga mental; pasar de 7 rara vez mejora la fiabilidad
  4. Da ejemplos de referencia - en la descripción, indica qué representa cada extremo de la escala
  5. Activa la puntuación global para agregar - show_overall viene bien cuando necesitas una métrica resumen junto al desglose detallado

Lectura Adicional

Para detalles de implementación, consulta la documentación fuente.