Evaluación por Rúbrica
Crea cuadrículas de evaluación con varios criterios en Potato para valorar salidas de LLM, corregir redacciones, medir calidad de traducción y cualquier tarea de anotación estructurada por rúbrica.
El esquema de anotación de evaluación por rúbrica ofrece una cuadrícula estructurada para puntuar contenido según varios criterios en una escala definida. Sirve para evaluar salidas de LLM, corregir redacciones, valorar la calidad de una traducción o cualquier tarea que necesite una puntuación estructurada en varias dimensiones.
Rubric evaluation in Potato
Visión General
El esquema de evaluación por rúbrica presenta:
- Una cuadrícula de criterios, cada uno con su propia escala de valoración
- Etiquetas de escala que van de Deficiente a Excelente (personalizables)
- Puntuación global opcional que resume el conjunto de criterios
- Descripciones de cada criterio para orientar a los anotadores
Resulta especialmente útil para la evaluación humana estructurada de salidas de IA generativa.
Inicio Rápido
annotation_schemes:
- annotation_type: rubric_eval
name: response_quality
description: Evaluate the quality of this AI-generated response.
scale_points: 5
criteria:
- name: Accuracy
description: Is the information factually correct?
- name: Relevance
description: Does the response address the question?
- name: Fluency
description: Is the response well-written and natural?Opciones de Configuración
| Campo | Tipo | Predeterminado | Descripción |
|---|---|---|---|
annotation_type | string | Requerido | Debe ser "rubric_eval" |
name | string | Requerido | Identificador único para este esquema |
description | string | Requerido | Instrucciones mostradas a los anotadores |
scale_points | integer | 5 | Número de puntos de la escala de valoración |
scale_labels | array | ["Poor", "Fair", "Average", "Good", "Excellent"] | Etiquetas de cada punto de la escala (su longitud debe coincidir con scale_points) |
criteria | array | Requerido | Lista de objetos de criterio, cada uno con name y description opcional |
show_overall | boolean | false | Muestra una fila adicional de puntuación global debajo de los criterios |
Ejemplos
Evaluación de Salidas de LLM
annotation_schemes:
- annotation_type: rubric_eval
name: llm_eval
description: Rate the quality of this model-generated response.
scale_points: 5
scale_labels:
- Poor
- Fair
- Average
- Good
- Excellent
show_overall: true
criteria:
- name: Helpfulness
description: Does the response provide useful and actionable information?
- name: Accuracy
description: Is the response factually correct and free of hallucinations?
- name: Harmlessness
description: Is the response free of harmful, biased, or inappropriate content?
- name: Coherence
description: Is the response logically structured and easy to follow?Corrección de Redacciones
annotation_schemes:
- annotation_type: rubric_eval
name: essay_grade
description: Grade this student essay using the rubric below.
scale_points: 4
scale_labels:
- Below Expectations
- Approaching
- Meets Expectations
- Exceeds Expectations
criteria:
- name: Thesis
description: Is there a clear and arguable thesis statement?
- name: Evidence
description: Does the essay use relevant evidence to support claims?
- name: Organization
description: Is the essay logically organized with clear transitions?
- name: Grammar
description: Is the writing free of grammatical and spelling errors?Valoración de la Calidad de Traducción
annotation_schemes:
- annotation_type: rubric_eval
name: translation_quality
description: Evaluate the quality of this machine translation.
scale_points: 3
scale_labels:
- Unacceptable
- Acceptable
- Perfect
criteria:
- name: Adequacy
description: Does the translation convey the same meaning as the source?
- name: Fluency
description: Does the translation read naturally in the target language?
- name: Terminology
description: Are domain-specific terms translated correctly?Formato de Salida
{
"response_quality": {
"labels": {
"Accuracy": 4,
"Relevance": 5,
"Fluency": 3
},
"overall": 4
}
}Cada criterio se asocia al valor de escala elegido (empezando en 1). El campo overall solo aparece cuando show_overall está en true.
Mejores Prácticas
- Mantén los criterios independientes - cada criterio debe medir una dimensión distinta para no puntuar dos veces lo mismo
- Escribe descripciones claras - los anotadores deben saber sin ambigüedad qué mide cada criterio
- Usa entre 3 y 5 puntos de escala - menos puntos reducen la carga mental; pasar de 7 rara vez mejora la fiabilidad
- Da ejemplos de referencia - en la descripción, indica qué representa cada extremo de la escala
- Activa la puntuación global para agregar -
show_overallviene bien cuando necesitas una métrica resumen junto al desglose detallado
Lectura Adicional
- Escalas Likert - Escalas de valoración de una sola dimensión
- Comparación por Pares - Evaluación lado a lado
- Control de Calidad - Verificaciones de atención y estándares de referencia
Para detalles de implementación, consulta la documentación fuente.