Skip to content

Segmento de Error

Crea interfaces de anotación de errores al estilo MQM en Potato para evaluar la calidad de traducciones, marcar errores en texto y anotar segmentos de error tipificados con puntuación de gravedad.

El esquema de anotación de segmentos de error ofrece una interfaz al estilo MQM (Multidimensional Quality Metrics) para marcar errores en un texto con categorías tipificadas y niveles de gravedad. Es un esquema ideal para evaluar la calidad de traducciones, revisar ediciones de texto, valorar la calidad de contenidos y cualquier tarea que requiera anotación de errores de grano fino.

Potato error span interface for marking translation errors with severity scoresError span in Potato

Visión General

El esquema de segmentos de error ofrece:

  • Categorías de error tipificadas con subtipos opcionales para una clasificación detallada
  • Niveles de gravedad con descuentos de puntos configurables
  • Puntuación de calidad continua que baja a medida que se marcan errores
  • Segmentos con código de color que distinguen visualmente tipos y gravedades de error

Los anotadores seleccionan segmentos de texto, les asignan un tipo de error y una gravedad, y el sistema calcula automáticamente una puntuación de calidad.

Inicio Rápido

yaml
annotation_schemes:
  - annotation_type: error_span
    name: translation_errors
    description: Mark all errors in the translation below.
    error_types:
      - name: Accuracy
      - name: Fluency
      - name: Terminology
    show_score: true
    max_score: 100

Opciones de Configuración

CampoTipoPredeterminadoDescripción
annotation_typestringRequeridoDebe ser "error_span"
namestringRequeridoIdentificador único para este esquema
descriptionstringRequeridoInstrucciones mostradas a los anotadores
error_typesarrayRequeridoLista de objetos de tipo de error, cada uno con name y un array subtypes opcional
severitiesarray[{name: "Minor", weight: -1}, {name: "Major", weight: -5}, {name: "Critical", weight: -10}]Lista de niveles de gravedad con name y weight (descuento de puntos)
show_scorebooleantrueMuestra una puntuación de calidad continua
max_scoreinteger100Puntuación de calidad de partida antes de los descuentos

Ejemplos

Calidad de Traducción (MQM)

yaml
annotation_schemes:
  - annotation_type: error_span
    name: mqm_errors
    description: >
      Mark all errors in the machine translation.
      Select the error span, choose a category and severity.
    error_types:
      - name: Accuracy
        subtypes:
          - Mistranslation
          - Addition
          - Omission
          - Untranslated
      - name: Fluency
        subtypes:
          - Grammar
          - Spelling
          - Punctuation
          - Register
      - name: Terminology
        subtypes:
          - Inconsistent
          - Wrong Term
      - name: Style
    severities:
      - name: Minor
        weight: -1
      - name: Major
        weight: -5
      - name: Critical
        weight: -10
    show_score: true
    max_score: 100

Revisión de Edición de Contenido

yaml
annotation_schemes:
  - annotation_type: error_span
    name: editing_errors
    description: Mark all issues that need editing in this article.
    error_types:
      - name: Factual Error
      - name: Grammar
        subtypes:
          - Subject-Verb Agreement
          - Tense
          - Pronoun Reference
      - name: Style
        subtypes:
          - Wordiness
          - Passive Voice
          - Jargon
      - name: Formatting
    severities:
      - name: Suggestion
        weight: -1
      - name: Required Fix
        weight: -5
    show_score: false

Anotación de Revisión de Código

yaml
annotation_schemes:
  - annotation_type: error_span
    name: code_errors
    description: Mark issues in this code snippet.
    error_types:
      - name: Bug
        subtypes:
          - Logic Error
          - Off-by-One
          - Null Reference
      - name: Style
        subtypes:
          - Naming
          - Formatting
      - name: Security
        subtypes:
          - Injection
          - Exposure
      - name: Performance
    severities:
      - name: Nitpick
        weight: -1
      - name: Warning
        weight: -3
      - name: Blocker
        weight: -10
    max_score: 100
    show_score: true

Formato de Salida

json
{
  "translation_errors": {
    "labels": {
      "errors": [
        {
          "start": 12,
          "end": 25,
          "text": "incorrectly translated",
          "error_type": "Accuracy",
          "subtype": "Mistranslation",
          "severity": "Major"
        },
        {
          "start": 45,
          "end": 52,
          "text": "the the",
          "error_type": "Fluency",
          "subtype": "Grammar",
          "severity": "Minor"
        }
      ],
      "score": 94
    }
  }
}

La puntuación se calcula como max_score más la suma de todos los pesos de gravedad.

Mejores Prácticas

  1. Define fronteras claras entre tipos de error - los anotadores no deberían dudar entre dos tipos de error; incluye ejemplos en la descripción
  2. Usa subtipos para ganar granularidad - los tipos de primer nivel mantienen la interfaz sencilla mientras que los subtipos permiten un análisis detallado cuando hace falta
  3. Calibra con cuidado los pesos de gravedad - las proporciones entre pesos deben reflejar el impacto real; un error crítico debe costar bastante más que uno menor
  4. Ajusta max_score a la longitud del texto - en textos cortos, un max_score más bajo evita que un solo error tenga un peso desmedido
  5. Proporciona pautas de anotación - la anotación al estilo MQM gana mucho con pautas detalladas que incluyan ejemplos de cada tipo de error y cada gravedad

Lectura Adicional

Para detalles de implementación, consulta la documentación fuente.