Potato 2.7 : mesurer comment naissent les étiquettes
Potato 2.7 ajoute des étiquettes avec barres d'erreur, des salles de normalisation en direct, des sondes contrefactuelles de frontière, la notation par prédiction des pairs, des justifications vocales traitées en local, des rapports de jeu de données en une commande et l'annotation mobile, sans qu'aucune de ces fonctionnalités n'ait besoin d'un LLM. Plus l'évaluation d'agents multi-agents et multimodaux.
Un outil d'annotation recueille des étiquettes. C'est son travail, et Potato le fait depuis 2022. Mais une étiquette est le produit d'une décision, et pendant la plus grande partie de la dernière décennie cette décision est restée invisible : on obtient la réponse, pas le raisonnement, ni la confiance, ni le désaccord qui l'ont produite.
Potato 2.7 repose sur une seule idée. Un outil d'annotation devrait mesurer comment les jugements sont rendus, et pas seulement consigner ce qu'ils étaient. Cela vaut pour les deux sortes de juges : les humains qui annotent, et les modèles d'IA que l'on évalue.
Potato 2.7
Des étiquettes avec barres d'erreur
Le moteur psychométrique ajuste un modèle de théorie de la réponse à l'item au fur et à mesure que les annotations arrivent, en estimant l'aptitude de chaque annotateur et la difficulté de chaque élément à partir du seul motif des accords. Aucune étiquette étalon, aucun LLM.
Au lieu de sarcastic (2 of 3 votes), votre export indique sarcastic, p = 0.94 [0.88 – 0.97]. La probabilité pèse qui a voté, et pas seulement combien.
assignment_strategy: psychometric
psychometrics:
enabled: true
confidence_threshold: 0.95 # items above this stop consuming budgetDeux conséquences découlent du modèle. Les éléments dont la probabilité a posteriori est déjà tranchée cessent d'être servis, si bien que la redondance va là où elle sert vraiment. Et quand la discrimination d'un élément devient négative, c'est-à-dire quand ce sont vos meilleurs annotateurs qui s'écartent de la foule, c'est en général une consigne cassée plutôt qu'un mauvais annotateur. Le tableau de bord le signale comme un problème probable de livre de codes.
La réunion de calibrage, dans l'outil
Toutes les équipes d'annotation tiennent des séances de normalisation, presque toujours en partage d'écran, et le résultat finit dans les notes de quelqu'un. Les salles multijoueur font entrer cette séance dans Potato et l'instrumentent.
Tout le monde vote à l'aveugle. L'hôte révèle. Le groupe débat. Chacun peut changer son vote, et chaque changement postérieur à la révélation est enregistré avec la majorité du moment, ce qui donne un relevé de conformité par membre. Un indicateur en direct de l'α de Krippendorff tourne à la fois sur les votes à l'aveugle et sur les votes actuels : l'écart entre les deux vous dit ce que la discussion a réellement apporté, pendant qu'elle a lieu.
Les salles huddle se remplissent d'elles-mêmes avec les éléments sur lesquels votre équipe est actuellement en désaccord. Les salles shadow permettent aux personnes en formation de regarder un annotateur chevronné travailler, surlignages compris.
Le contrôle qualité sans étiquettes étalons
Deux fonctionnalités attaquent le même problème par des chemins différents, et aucune des deux ne glisse de faux élément.
Truth Serum pose une question de plus après chaque étiquette : quel pourcentage des autres annotateurs choisira ce que vous avez choisi ? Ces prédictions alimentent l'estimateur de la réponse étonnamment populaire (Prelec, Seung & McCoy 2017, Nature), qui bat le vote majoritaire précisément là où l'annotation est difficile : quand une foule sûre d'elle se trompe et qu'une minorité informée a raison. À notre connaissance, Potato est le premier outil d'annotation à proposer la notation par prédiction des pairs.
Le laboratoire de frontières de décision montre une modification contrefactuelle minimale juste après la pose d'une étiquette et demande si l'étiquette y survit. Répondre prend un clic, et l'annotation ordinaire se met à produire des ensembles de contraste (Gardner et al. 2020) comme sous-produit. Certaines sondes sont des paraphrases qui préservent le sens, et un annotateur qui bascule dessus vous apprend quelque chose, sans qu'un seul élément étalon ait été planté.
Le raisonnement humain, capté mot à mot
Le mode Think-Aloud laisse les annotateurs parler pendant qu'ils travaillent. La reconnaissance vocale tourne en local via faster-whisper : rien ne quitte la machine et il n'y a pas de coût au token. La transcription est conservée mot à mot et délibérément non résumée, parce que paraphraser un protocole de pensée à voix haute détruit l'objet même que l'on cherchait à recueillir.
Il ne s'agit pas seulement de justifications. C'est l'enregistrement de la façon dont une personne raisonne jusqu'à une étiquette, la contrepartie humaine de l'outillage de récompense de processus qui découpe la façon dont un modèle raisonne. Même élément, deux chaînes de raisonnement.
Deux de plus, puis les agents
Le mode article transforme un projet en rapport de jeu de données LaTeX compilable en une commande : distributions d'étiquettes, tableau des annotateurs, statistiques d'accord avec les bonnes citations, temps passé et un paragraphe de limites honnête, avec de vrais chiffres dedans.
python -m potato.paper config.yaml -o paper_exportLe mode poche fait de l'annotation mobile un usage de plein droit : les appareils tactiles reçoivent une pile de cartes à balayer avec des boutons dans la zone du pouce et une synchronisation hors ligne. Les tâches qui ont réellement besoin d'un ordinateur (spans, boîtes englobantes, vidéo) ne sont jamais dégradées vers le téléphone. Elles reçoivent un avertissement à la place.
Évaluer les agents d'IA
L'autre moitié de la 2.7 applique la même philosophie aux modèles. La suite d'évaluation d'agents annote désormais une exécution multi-agents comme une équipe et non comme une transcription à plat : graphe d'interactions cliquable, attribution des échecs entre agents, revue des passages de relais, fiches de score par agent et pour l'équipe, chronologie des contentions sur les outils et étiquetage des comportements émergents à travers les agents.
Les agents multimodaux ont leurs propres surfaces : trajectoires d'interface graphique et d'usage de l'ordinateur avec ancrage des clics, chronologies vocales en duplex intégral avec détection des interruptions, ancrage temporel vidéo avec IoU en direct, et structure des tableaux de documents.
Si vous préférez un parcours guidé à une liste, nous en avons écrit un sur déboguer les échecs multi-agents.
Là où les deux moitiés se rejoignent
C'est la même idée dirigée vers deux juges différents, et la 2.7 les relie entre elles.
Think-Aloud enregistre la façon dont une personne raisonne jusqu'à une étiquette. L'annotation de récompense de processus capture la façon dont un modèle raisonne, étape par étape. Mettez-les côte à côte sur le même élément et vous voyez où le jugement humain et le jugement machine divergent.
Et un juge LLM n'est fiable que dans la mesure où le sont les étiquettes humaines qui ont servi à le valider. Le tableau de bord d'alignement juge–humain vous dit à quel point votre juge s'accorde avec les gens ; la psychométrie et Truth Serum donnent à ces étiquettes humaines des intervalles de confiance. « Le juge est d'accord avec les humains » cesse d'être une impression et devient une affirmation assortie d'un intervalle.
Tout le reste
L'annotation d'événements inter-documents, l'annotation au niveau du tour sur les conversations et les traces, un livre de codes vivant avec éditeur pleine page, le lien inter-pages dans les PDF avec OCR optionnel, des rôles RBAC avec schémas par cohorte, et des tableaux de bord administrateur et annotateur en dix langues.
L'installation s'est allégée, elle aussi. Les SDK d'IA se chargent désormais paresseusement : un simple pip install potato-annotation n'entraîne plus aucun SDK d'IA, et le temps de démarrage passe d'environ 2,0 secondes à 0,7.
Se le procurer
pip install --upgrade potato-annotationPotato est gratuit, open source sous GPL-3.0-or-later et auto-hébergeable. Les sept fonctionnalités ci-dessus sont optionnelles, indépendantes de la tâche, et aucune n'exige de LLM. Cela compte si vos données ne peuvent pas sortir de votre établissement, ou si votre budget ne peut pas absorber une facture au token.
Potato 2.0 a été publié à ACL 2026 (System Demonstrations). Si Potato vous sert dans vos recherches, c'est l'article à citer.
Commencez par le démarrage rapide, parcourez les nouveautés, ou lisez les articles de fond sur les étiquettes avec barres d'erreur et le contrôle qualité sans étiquettes étalons.