Skip to content

La concordancia entre anotadores, explicada

Una guía práctica sobre la concordancia entre anotadores: acuerdo porcentual, kappa de Cohen y de Fleiss, alfa de Krippendorff, cuándo usar cada métrica y cómo las reporta Potato.

La concordancia entre anotadores (IAA) mide con qué frecuencia anotadores independientes asignan la misma etiqueta. Es la evidencia estándar de que una tarea de anotación está bien definida y de que las etiquetas resultantes son fiables. Una concordancia baja suele significar que las directrices no son claras, no que los anotadores sean descuidados.

El tema general es la fiabilidad entre evaluadores. Potato calcula la concordancia en tiempo real en el panel de administración; consulta Control de calidad.

Por qué el acuerdo porcentual bruto no basta

La medida más simple es el acuerdo porcentual: la fracción de elementos que los anotadores etiquetaron de forma idéntica. El problema es que parte del acuerdo ocurre por azar. Si dos anotadores eligen "positivo" el 90 % de las veces, coincidirán la mayor parte del tiempo incluso etiquetando al azar. Las medidas corregidas por azar resuelven esto.

Un coeficiente corregido por azar tiene la forma:

text
        P_observed − P_expected
  κ =  ─────────────────────────
            1 − P_expected

donde P_observed es el acuerdo real y P_expected es el acuerdo esperado por azar. Un valor de 1 indica acuerdo perfecto; 0 indica un nivel equivalente al azar.

Las tres que de verdad vas a usar

  • Kappa de Cohen: dos anotadores, etiquetas categóricas. La elección clásica para una pareja.
  • Kappa de Fleiss: más de dos anotadores, etiquetas categóricas, cuando distintos elementos pueden ser juzgados por distintos evaluadores.
  • Alfa de Krippendorff: la opción más general. Funciona con cualquier número de anotadores, gestiona los datos faltantes y admite datos nominales, ordinales, de intervalo y de razón. Es lo que Potato reporta por defecto.

Usa kappa para parejas categóricas simples; recurre al alfa de Krippendorff cuando tengas muchos anotadores, solapamiento incompleto o etiquetas ordenadas/continuas (donde "equivocarse por uno" debería penalizar menos que "equivocarse por cuatro").

¿Kappa de Fleiss o alfa de Krippendorff con tres anotadores?

Si los tres anotadores etiquetaron todos los ítems y las etiquetas son categorías sin orden, cualquiera de los dos coeficientes es defendible. Si a algún ítem le falta una etiqueta, o si las etiquetas tienen orden, usa el alfa de Krippendorff.

Los dos difieren en lo que suponen:

  • Etiquetas que faltan. La kappa de Fleiss espera el mismo número de valoraciones en cada ítem. Si uno de los tres anotadores se saltó un ítem, tienes que descartar ese ítem. El alfa de Krippendorff usa todas las valoraciones que tiene.
  • Nivel de medida. La kappa de Fleiss trata las etiquetas como no ordenadas, así que en una escala de 1 a 5 un 4 frente a un 5 cuenta como el mismo desacuerdo que un 1 frente a un 5. El alfa de Krippendorff admite una métrica de distancia (nominal, ordinal, de intervalo o de razón) y puntúa las diferencias pequeñas como desacuerdos menores.
  • Muestras pequeñas. El alfa de Krippendorff incluye una corrección para muestras pequeñas, así que en un piloto de unas pocas docenas de ítems los dos pueden separarse aunque los datos sirvan para ambos.

Con datos nominales completos y un número razonable de ítems, los dos suelen quedar cerca. Informa del que espera tu campo y nombra el coeficiente y la métrica en el artículo, porque «la concordancia fue de 0,72» significa cosas distintas con cada uno.

Potato informa del alfa de Krippendorff. Antes de la versión 2.9, el alfa ordinal de una escala Likert con etiquetas de texto ordenaba esas etiquetas alfabéticamente, lo que en la práctica la volvía nominal. Si informaste de concordancia ordinal sobre escalas con etiquetas de texto con una versión anterior, vuelve a calcularla después de actualizar. También puedes revisar una tabla de etiquetas en el navegador con la calculadora de concordancia, que calcula el alfa nominal, ordinal y de intervalo junto con la kappa de Cohen y la de Fleiss.

Cómo interpretar el número

No existe un umbral universal, pero una guía aproximada habitual para alfa/kappa es:

  • ≥ 0,80: suficiente para confiar en los datos.
  • 0,67–0,80: utilizable para conclusiones provisionales; investiga los desacuerdos.
  • < 0,67: revisa las directrices antes de confiar en las etiquetas.

Trata estos valores como un aviso para investigar, no como una barrera de aprobado/suspenso. Mira siempre qué elementos y qué etiquetas provocan el desacuerdo.

Cómo medirla en Potato

Haz que los anotadores se solapen en un subconjunto compartido y luego activa el informe de concordancia:

yaml
agreement_metrics:
  enabled: true
  # Krippendorff's alpha is reported in the admin dashboard.

Para tareas de tramos (span) y estructuradas, mide la concordancia en el nivel que te importa (coincidencia exacta del tramo frente a solapamiento), porque las métricas a nivel de documento ocultan los desacuerdos en los límites.

Cuando la concordancia es baja

  1. Lee los elementos en desacuerdo: ¿la directriz es ambigua o el elemento es genuinamente difícil?
  2. Afina las definiciones y añade los casos difíciles como ejemplos. Consulta Redacción de directrices de anotación.
  3. Vuelve a hacer una prueba piloto. Si la concordancia sigue siendo baja en tareas genuinamente subjetivas, plantéate registrar el propio desacuerdo en lugar de forzar una única respuesta.

Lecturas adicionales