Control de calidad sin etiquetas de oro
Los estándares de referencia salen caros, se filtran y solo comprueban los elementos que se te ocurrió colar. Dos alternativas, la puntuación por predicción entre pares y las sondas contrafactuales de frontera, detectan a los anotadores despistados y las directrices rotas sin colar ni un solo elemento.
La forma habitual de comprobar la calidad de una anotación es colar elementos cuya respuesta ya conoces y ver quién falla. Funciona, pero construirlos sale caro, solo se comprueban los casos que se te ocurrió colar y los anotadores con experiencia acaban aprendiendo a detectarlos. Hay dos técnicas que dan señal de calidad sin ningún elemento de oro: la puntuación por predicción entre pares, que pide a los anotadores que predigan qué dirán los demás, y el sondeo contrafactual, que pregunta si una etiqueta sobrevive a una edición pequeña. Potato incorpora las dos, como Truth Serum y el Laboratorio de fronteras.
Los estándares de referencia y las comprobaciones de atención son la respuesta por defecto a «¿cómo sé si mis anotadores están prestando atención?», y se la han ganado. Pero tienen tres costes reales.
Hay que construirlos, lo que significa tiempo de un experto etiquetando elementos que ya entiende. Solo cubren los modos de fallo que anticipaste. Y en cualquier tarea que dure lo suficiente, los anotadores acaban reconociéndolos. Un elemento de oro que se reutiliza es un elemento de oro que deja de medir nada.
Las dos técnicas de abajo esquivan los tres problemas, y ninguna necesita un LLM.
Predicción entre pares: pregunta qué dirán los demás
Después de que un anotador elija una etiqueta, Truth Serum pregunta una cosa más:
Has elegido Sarcastic. ¿Qué porcentaje del resto de anotadores elegirá la misma etiqueta que tú?
Un deslizador. Un clic. Ese único número extra hace un trabajo sorprendente.
La tarjeta de predicción de Truth Serum
Por qué la predicción es informativa
El método es el principio de lo sorprendentemente popular (Prelec, Seung y McCoy 2017, Nature, que parte del suero de la verdad bayesiano de Prelec, 2004). La afirmación es que la mejor estimación de la verdad no es la respuesta más popular, sino la respuesta más popular de lo que la gente predijo que sería.
El razonamiento va así. Quien sostiene una postura minoritaria correcta suele saber que está en minoría. Ve por qué la mayoría respondería de otro modo, y lo dice cuando le pides que haga una predicción. En cambio, quien sostiene un error extendido tiende a dar por hecho que todo el mundo piensa igual. Así que cuando una respuesta supera su propia popularidad predicha, esa diferencia es indicio de que quienes la eligen saben algo que la mayoría no sabe.
El voto mayoritario falla más estrepitosamente justo donde una mayoría convencida se equivoca y una minoría informada acierta. Ese es el caso para el que se diseñó la puntuación por sorprendentemente popular.
truth_serum:
enabled: true
schema: sarcasm
min_annotators: 5Hasta donde sabemos, Potato es la primera herramienta de anotación que incorpora puntuación por predicción entre pares.
Qué sacas de ello
Tres cosas, y ninguna necesitó una plantilla de respuestas.
Una cola de «dónde es probable que la mayoría se equivoque». Cada elemento cuya etiqueta sorprendentemente popular difiere de su etiqueta mayoritaria. Son los elementos que merecen la atención de un experto, y suele haber muchos menos de los que temías.
Puntuaciones de calibración por anotador. Cuánto se aleja el acuerdo que cada persona predijo del acuerdo que realmente obtuvo. Quien predice sistemáticamente que el 90 % del resto coincidirá con él y obtiene sistemáticamente un 55 % te está diciendo algo sobre su autoconocimiento. Y lo has averiguado sin colar nada.
Alineación con SP. Con qué frecuencia la etiqueta de cada anotador coincide con el veredicto sorprendentemente popular, que sirve como indicio aproximado de estar informado y no solo de resultar complaciente.
Una advertencia antes de citarlo: esta es la variante simplificada de predicción sobre la propia respuesta, en la que cada anotador predice la popularidad de la etiqueta que eligió en lugar de una distribución completa sobre todas las etiquetas. Y min_annotators: 3 es un mínimo, no una recomendación. A partir de cinco es cuando los veredictos dejan de ser ruidosos.
Sondas contrafactuales: pregunta si la etiqueta sobrevive a una edición
Truth Serum encuentra los elementos en los que la mayoría se equivocó. El Laboratorio de fronteras encuentra otra cosa: los puntos donde tu manual de codificación es ambiguo, y los anotadores que no están leyendo de verdad.
En cuanto se confirma una etiqueta, Potato muestra una edición mínima del texto y pregunta si la etiqueta sigue valiendo.
Has dicho Polite. ¿Seguiría siendo así tras esta edición?
Una sonda del Laboratorio de fronteras
Responder cuesta un clic. Pero, por el hecho de haber preguntado, la anotación corriente pasa a producir tres cosas que una exportación de etiquetas a secas no da.
Conjuntos de contraste, como subproducto
Cada sonda respondida es un par etiquetado (original, contrafactual). Eso es un conjunto de contraste: datos aumentados con contrafactuales del tipo que ha demostrado mejorar la robustez de los modelos (Gardner et al. 2020, Evaluating Models' Local Decision Boundaries via Contrast Sets; Kaushik et al. 2020).
Los conjuntos de contraste suelen ser un trabajo de anotación aparte y caro. Aquí salen del etiquetado que ibas a hacer de todas formas.
boundary_probing:
enabled: true
schema: politeness
probes_per_item: 3
include_invariance: true
sources: [precomputed, llm, rules]La lista sources es una cadena de respaldo. Puedes incluir contrafactuales curados junto a tus datos, generarlos con un LLM o dejar que el nivel basado en reglas los produzca a partir de transformaciones léxicas como negaciones que se activan y desactivan, cambios de intensificadores y marcadores de cortesía. Ese último nivel es la razón de que el Laboratorio de fronteras funcione sin ningún LLM configurado, y de que la función se degrade con elegancia en lugar de romperse cuando nadie ha puesto una clave de API.
Control de calidad invisible
Algunas sondas son sondas de invariancia: paráfrasis que conservan el significado. «Mándame las diapositivas antes de la reunión» («Send me the slides before the meeting») pasa a ser «Antes de la reunión, mándame las diapositivas» («Before the meeting, send me the slides»).
Un anotador consistente nunca cambia de etiqueta ante ellas. Quien lo hace, o no está leyendo con atención o no tiene una idea estable de qué significa la etiqueta. En cualquiera de los dos casos te interesa saberlo, y lo has averiguado sin colar ni un solo elemento falso. La sonda es indistinguible del trabajo corriente, porque es trabajo corriente.
El panel marca a los anotadores cuya tasa de mantenimiento en las sondas de invariancia baja del 60 %.
Justificaciones de frontera
Cuando una etiqueta sí cambia, el anotador dice qué cruzó la línea: «el please suaviza la orden». Esas justificaciones se van acumulando hasta formar un mapa de dónde exactamente tu directriz está poco especificada, que es la materia prima de una directriz mejor.
El panel también informa de la sensibilidad de frontera por etiqueta: de las ediciones mínimas dirigidas a cada etiqueta, qué proporción la cambió de verdad. Una etiqueta con un 90 % de cambios vive al filo de la navaja y seguramente necesita una definición más clara. Una etiqueta al 10 % es robusta.
¿Cuál deberías usar?
Responden preguntas distintas, y se combinan.
| Truth Serum | Laboratorio de fronteras | |
|---|---|---|
| Encuentra | Elementos en los que la mayoría probablemente se equivocó | Directrices ambiguas; anotadores despistados |
| Le cuesta al anotador | Un deslizador por elemento | Un clic por sonda |
| Produce | Mejores veredictos, puntuaciones de calibración | Conjuntos de contraste, justificaciones de frontera |
| Necesita un LLM | No | No (nivel basado en reglas) |
Si lo que te preocupa es «la etiqueta de consenso puede estar mal en los casos difíciles», empieza por Truth Serum. Si es «no creo que mi manual de codificación sea lo bastante preciso, y no las tengo todas conmigo de que todo el mundo esté leyendo», empieza por el Laboratorio de fronteras.
Ninguna de las dos sustituye a las etiquetas con barras de error, que te dicen cuánta confianza depositar en cada etiqueta y a qué anotadores ponderar. Las tres juntas te dan un estudio donde la calidad se mide de forma continua en vez de por muestreo, y donde nada de esa medición depende de una plantilla de respuestas que hubieras tenido que construir antes.
Lecturas adicionales
- Truth Serum y Laboratorio de fronteras — configuración completa
- Etiquetas con barras de error — posteriores TRI y el detector de fallos del manual de codificación
- Estándares de referencia y comprobaciones de atención — el enfoque clásico, y cuándo sigue siendo el adecuado
- Control de calidad
- Cómo escribir directrices de anotación