Potato 2.7: medir cómo se fabrican las etiquetas
Potato 2.7 añade etiquetas con barras de error, salas de normalización en vivo, sondas contrafactuales de frontera, puntuación por predicción entre pares, justificaciones habladas en local, informes de dataset con un solo comando y anotación desde el móvil, y nada de eso necesita un LLM. Además, evaluación de agentes multiagente y multimodales.
Una herramienta de anotación recoge etiquetas. Ese es el trabajo, y Potato lo hace desde 2022. Pero una etiqueta es el resultado de una decisión, y durante casi toda la última década la decisión en sí ha sido invisible: te llevas la respuesta, no el razonamiento, ni la confianza, ni el desacuerdo que la produjo.
Potato 2.7 se apoya en una sola idea. Una herramienta de anotación debería medir cómo se toman los juicios, y no limitarse a registrar cuáles fueron. Eso vale para los dos tipos de juez: las personas que anotan y los modelos de IA que se evalúan.
Potato 2.7
Etiquetas con barras de error
El motor psicométrico ajusta un modelo de teoría de respuesta al ítem a medida que llegan las anotaciones, y estima la capacidad de cada anotador y la dificultad de cada elemento solo a partir del patrón de acuerdo. Sin etiquetas de oro y sin ningún LLM.
En lugar de sarcastic (2 of 3 votes), tu exportación dice sarcastic, p = 0.94 [0.88 – 0.97]. La probabilidad pondera quién votó, no solo cuántos.
assignment_strategy: psychometric
psychometrics:
enabled: true
confidence_threshold: 0.95 # items above this stop consuming budgetDel modelo salen dos cosas. Los elementos cuya posterior ya es firme dejan de servirse, así que la redundancia va donde de verdad hace falta. Y cuando la discriminación de un elemento se vuelve negativa, es decir, cuando tus mejores anotadores son los que discrepan de la mayoría, lo normal es que la directriz esté rota y no el anotador. El panel lo marca como posible fallo del manual de codificación.
La reunión de calibración, dentro de la herramienta
Todos los equipos de anotación hacen sesiones de normalización, y casi siempre ocurren por pantalla compartida con el resultado viviendo en los apuntes de alguien. Las salas multijugador llevan esa sesión a Potato y la instrumentan.
Todo el mundo vota a ciegas. El anfitrión revela. El grupo discute. Cualquiera puede cambiar su voto, y cada cambio posterior a la revelación queda registrado junto con cuál era la mayoría en ese momento, lo que da un registro de conformidad por miembro. Un medidor en vivo del α de Krippendorff corre a la vez sobre los votos a ciegas y sobre los votos actuales, así que la diferencia entre ambos te dice para qué sirvió realmente la discusión, mientras está ocurriendo.
Las salas huddle se llenan solas con los elementos en los que tu equipo discrepa ahora mismo. Las salas shadow permiten que quien está en formación vea trabajar a un anotador veterano, con resaltados incluidos.
Control de calidad sin etiquetas de oro
Dos funciones atacan el mismo problema desde ángulos distintos, y ninguna de las dos cuela un elemento falso.
Truth Serum hace una pregunta extra después de cada etiqueta: ¿qué porcentaje del resto de anotadores elegirá lo que has elegido tú? Esas predicciones alimentan el estimador de lo sorprendentemente popular (Prelec, Seung y McCoy 2017, Nature), que supera al voto mayoritario justo donde la anotación es difícil: cuando una mayoría convencida se equivoca y una minoría informada acierta. Hasta donde sabemos, Potato es la primera herramienta de anotación que incorpora puntuación por predicción entre pares.
El Laboratorio de fronteras muestra una edición contrafactual mínima justo después de que se confirme una etiqueta y pregunta si la etiqueta sobrevive. Responder cuesta un clic, y la anotación corriente empieza a producir conjuntos de contraste (Gardner et al. 2020) como subproducto. Algunas sondas son paráfrasis que conservan el significado, y un anotador que cambia de etiqueta ante ellas te está diciendo algo, sin necesidad de colar ni un solo elemento de oro.
El razonamiento humano, capturado al pie de la letra
El modo Think-Aloud deja que los anotadores hablen mientras trabajan. El paso de voz a texto se ejecuta en local con faster-whisper, así que nada sale de la máquina y no hay coste por token. La transcripción se guarda literal y deliberadamente sin resumir, porque parafrasear un protocolo de pensamiento en voz alta destruye el artefacto que intentabas recoger.
La idea no son solo las justificaciones. Esto es un registro de cómo razona una persona hasta llegar a una etiqueta, que es la contraparte humana de las herramientas de recompensa de proceso que segmentan cómo razona un modelo. El mismo elemento, dos cadenas de razonamiento.
Dos más, y luego los agentes
El modo artículo convierte un proyecto en un informe de dataset en LaTeX compilable con un solo comando: distribuciones de etiquetas, una tabla de anotadores, estadísticas de acuerdo con las citas correctas, tiempos y un párrafo de limitaciones honesto y con números reales dentro.
python -m potato.paper config.yaml -o paper_exportEl modo bolsillo convierte la anotación desde el móvil en algo de primera clase: los dispositivos táctiles reciben una pila de tarjetas deslizables con botones en la zona del pulgar y sincronización sin conexión. Las tareas que de verdad necesitan un escritorio (tramos, cuadros delimitadores, vídeo) nunca se degradan a un móvil. En su lugar reciben un aviso.
Evaluar agentes de IA
La otra mitad de la 2.7 apunta esa misma filosofía hacia los modelos. La suite de evaluación de agentes anota ahora una ejecución multiagente como un equipo en vez de como una transcripción plana: un grafo de interacción navegable, atribución de fallos entre agentes, revisión de traspasos, cuadros de puntuación por agente y de equipo, una línea de tiempo de contención de herramientas y etiquetado de comportamientos emergentes entre agentes.
Los agentes multimodales tienen sus propias superficies: trayectorias de GUI y de uso del ordenador con anclaje de clics, líneas de tiempo de voz full-duplex con detección de interrupciones, anclaje temporal en vídeo con IoU en vivo y estructura de tablas en documentos.
Si prefieres un recorrido guiado antes que una lista, escribimos uno sobre depurar fallos multiagente.
Dónde se encuentran las dos mitades
Son la misma idea apuntada a dos jueces distintos, y la 2.7 los conecta.
Think-Aloud registra cómo razona una persona hasta llegar a una etiqueta. La anotación de recompensa de proceso captura cómo razona un modelo, paso a paso. Ponlos uno junto al otro sobre el mismo elemento y verás dónde divergen el juicio humano y el de la máquina.
Y un juez LLM solo es fiable en la medida en que lo sean las etiquetas humanas contra las que lo validaste. El panel de alineación juez ↔ humano te dice hasta qué punto tu juez coincide con las personas; la psicometría y Truth Serum le ponen intervalos de confianza a las etiquetas de esas personas. "El juez coincide con los humanos" deja de ser una sensación y pasa a ser una afirmación con un intervalo detrás.
Todo lo demás
Anotación de eventos entre documentos, anotación por turnos sobre conversaciones y trazas, un manual de codificación como documento vivo con editor a página completa, enlazado entre páginas de PDF con OCR opcional, roles RBAC con esquemas por cohorte, y paneles de administración y de anotador en diez idiomas.
La instalación también adelgazó. Los SDK de IA ahora se cargan de forma perezosa, así que un pip install potato-annotation a secas no arrastra ningún SDK de IA y el tiempo de arranque baja de unos 2,0 segundos a 0,7.
Cómo conseguirlo
pip install --upgrade potato-annotationPotato es gratuito, de código abierto bajo GPL-3.0-or-later y autoalojable. Las siete funciones de arriba son opcionales, agnósticas a la tarea y ninguna necesita un LLM. Eso importa si tus datos no pueden salir de tu institución, o si tu presupuesto no aguanta una factura por token.
Potato 2.0 se publicó en ACL 2026 (System Demonstrations). Si Potato te resulta útil en tu investigación, ese es el artículo que hay que citar.
Empieza por el inicio rápido, echa un vistazo a las novedades o lee los análisis a fondo sobre etiquetas con barras de error y control de calidad sin etiquetas de oro.