Segmento de Error
Crea interfaces de anotación de errores al estilo MQM en Potato para evaluar la calidad de traducciones, marcar errores en texto y anotar segmentos de error tipificados con puntuación de gravedad.
El esquema de anotación de segmentos de error ofrece una interfaz al estilo MQM (Multidimensional Quality Metrics) para marcar errores en un texto con categorías tipificadas y niveles de gravedad. Es un esquema ideal para evaluar la calidad de traducciones, revisar ediciones de texto, valorar la calidad de contenidos y cualquier tarea que requiera anotación de errores de grano fino.
Error span in Potato
Visión General
El esquema de segmentos de error ofrece:
- Categorías de error tipificadas con subtipos opcionales para una clasificación detallada
- Niveles de gravedad con descuentos de puntos configurables
- Puntuación de calidad continua que baja a medida que se marcan errores
- Segmentos con código de color que distinguen visualmente tipos y gravedades de error
Los anotadores seleccionan segmentos de texto, les asignan un tipo de error y una gravedad, y el sistema calcula automáticamente una puntuación de calidad.
Inicio Rápido
annotation_schemes:
- annotation_type: error_span
name: translation_errors
description: Mark all errors in the translation below.
error_types:
- name: Accuracy
- name: Fluency
- name: Terminology
show_score: true
max_score: 100Opciones de Configuración
| Campo | Tipo | Predeterminado | Descripción |
|---|---|---|---|
annotation_type | string | Requerido | Debe ser "error_span" |
name | string | Requerido | Identificador único para este esquema |
description | string | Requerido | Instrucciones mostradas a los anotadores |
error_types | array | Requerido | Lista de objetos de tipo de error, cada uno con name y un array subtypes opcional |
severities | array | [{name: "Minor", weight: -1}, {name: "Major", weight: -5}, {name: "Critical", weight: -10}] | Lista de niveles de gravedad con name y weight (descuento de puntos) |
show_score | boolean | true | Muestra una puntuación de calidad continua |
max_score | integer | 100 | Puntuación de calidad de partida antes de los descuentos |
Ejemplos
Calidad de Traducción (MQM)
annotation_schemes:
- annotation_type: error_span
name: mqm_errors
description: >
Mark all errors in the machine translation.
Select the error span, choose a category and severity.
error_types:
- name: Accuracy
subtypes:
- Mistranslation
- Addition
- Omission
- Untranslated
- name: Fluency
subtypes:
- Grammar
- Spelling
- Punctuation
- Register
- name: Terminology
subtypes:
- Inconsistent
- Wrong Term
- name: Style
severities:
- name: Minor
weight: -1
- name: Major
weight: -5
- name: Critical
weight: -10
show_score: true
max_score: 100Revisión de Edición de Contenido
annotation_schemes:
- annotation_type: error_span
name: editing_errors
description: Mark all issues that need editing in this article.
error_types:
- name: Factual Error
- name: Grammar
subtypes:
- Subject-Verb Agreement
- Tense
- Pronoun Reference
- name: Style
subtypes:
- Wordiness
- Passive Voice
- Jargon
- name: Formatting
severities:
- name: Suggestion
weight: -1
- name: Required Fix
weight: -5
show_score: falseAnotación de Revisión de Código
annotation_schemes:
- annotation_type: error_span
name: code_errors
description: Mark issues in this code snippet.
error_types:
- name: Bug
subtypes:
- Logic Error
- Off-by-One
- Null Reference
- name: Style
subtypes:
- Naming
- Formatting
- name: Security
subtypes:
- Injection
- Exposure
- name: Performance
severities:
- name: Nitpick
weight: -1
- name: Warning
weight: -3
- name: Blocker
weight: -10
max_score: 100
show_score: trueFormato de Salida
{
"translation_errors": {
"labels": {
"errors": [
{
"start": 12,
"end": 25,
"text": "incorrectly translated",
"error_type": "Accuracy",
"subtype": "Mistranslation",
"severity": "Major"
},
{
"start": 45,
"end": 52,
"text": "the the",
"error_type": "Fluency",
"subtype": "Grammar",
"severity": "Minor"
}
],
"score": 94
}
}
}La puntuación se calcula como max_score más la suma de todos los pesos de gravedad.
Mejores Prácticas
- Define fronteras claras entre tipos de error - los anotadores no deberían dudar entre dos tipos de error; incluye ejemplos en la descripción
- Usa subtipos para ganar granularidad - los tipos de primer nivel mantienen la interfaz sencilla mientras que los subtipos permiten un análisis detallado cuando hace falta
- Calibra con cuidado los pesos de gravedad - las proporciones entre pesos deben reflejar el impacto real; un error crítico debe costar bastante más que uno menor
- Ajusta max_score a la longitud del texto - en textos cortos, un max_score más bajo evita que un solo error tenga un peso desmedido
- Proporciona pautas de anotación - la anotación al estilo MQM gana mucho con pautas detalladas que incluyan ejemplos de cada tipo de error y cada gravedad
Lectura Adicional
- Anotación de Segmentos - Etiquetado general de segmentos
- Vinculación de Segmentos - Vincular segmentos relacionados
- Control de Calidad - Verificaciones de atención y estándares de referencia
Para detalles de implementación, consulta la documentación fuente.