Skip to content

Medición e integridad

Potato informa la concordancia corregida por azar sobre geometría, tiempo, cuboides 3D, descripciones y puntos de ruptura de modelos del mundo, y registra cómo se produjeron las anotaciones. Panorama de la capa de medición.

Cada tipo de anotación en Potato viene con una forma de medir si los anotadores concuerdan, corregida por azar y con sus límites declarados. Eso incluye los tipos espaciales y temporales, donde el estándar del sector es el IoU crudo o el porcentaje de coincidencia, y ninguno de los dos corrige por azar.

Esta sección cubre las dos mitades de la pregunta: si las etiquetas concuerdan, y cómo se produjeron.

El hilo conductor

PreguntaMedida
¿Encontraron los anotadores los mismos objetos?α de detección
¿Los llamaron igual?α de clasificación
¿Los pusieron en el mismo sitio?σ y KS frente a una línea base empírica de azar
¿De qué máscara nos fiamos?STAPLE
¿Concuerdan en cuándo empieza un evento?IoU temporal y α de frontera
¿Concuerdan en una caja 3D?IoU 3D rotado exacto
¿Describen una región de la misma manera?α con una distancia semántica sobre texto
¿Concuerdan en cuándo se rompió el mundo?concordancia del punto de ruptura con barrido de tolerancia
¿Es competente un anotador?MACE, para las partes genuinamente categóricas

Por qué corregir por azar

La concordancia cruda se infla siempre que una respuesta domina, y casi siempre hay una respuesta que domina.

El caso más claro es el espacial. Un corpus donde cada imagen contiene un único objeto grande y centrado mostrará un IoU medio en torno a 0,95 sin importar quién lo anote, incluidos anotadores que nunca miraron la imagen y dibujaron una caja en el centro. La corrección por azar es lo que separa «estos anotadores concuerdan» de «esta tarea es demasiado fácil para que haya desacuerdo».

La mayoría de las plataformas de anotación informan la concordancia como IoU crudo, coincidencia exacta o porcentaje frente a un trabajo de referencia. Son números útiles que responden a otra pregunta. No hemos encontrado ninguna otra plataforma de anotación que informe un coeficiente corregido por azar para etiquetas espaciales.

Dos propiedades de diseño

Los valores indefinidos se explican solos. α está genuinamente indefinido en un corpus unánime. Un NaN a secas se lee como un cálculo roto y un 1.0 sería mentira, así que el informe dice con palabras cuál de los dos casos es.

Nada se trunca en silencio. Un informe que alcanza su presupuesto de comparaciones por pares lo declara e indica cuántos elementos incluyó. Un número calculado sobre una muestra que se presenta como calculado sobre todo es peor que ningún número.

El fallo por el que existe esta capa

La adjudicación comparaba las claves de una anotación, y un esquema de imagen guarda todo bajo una única clave llamada _data. Por eso cada par de imágenes puntuaba 1,0 de concordancia: dos anotadores que no coincidían en nada parecían unánimes, y ninguna imagen se enviaba nunca a revisión.

Está corregido, y es la razón por la que la capa de concordancia está integrada en cada tipo de anotación en lugar de añadida encima.

Cómo se produjeron los datos

La concordancia no puede detectar a dos anotadores que coinciden con seguridad en algo equivocado, ni una pre-etiqueta aceptada sin leerla. Dos herramientas abordan eso:

  • La telemetría de dibujo registra el tiempo por forma, la dinámica del trazo, el número de revisiones y la latencia al aceptar sugerencias de la IA.
  • El registro de pulsaciones es su gemelo del lado del texto, para cómo se produjo una respuesta libre.

Ambos son opcionales, y los anotadores ven un aviso de grabación.

Confianza y despliegue

Relacionado