Agreement Cannot Catch Rubber-Stamping
When annotators accept model pre-labels without reading them, inter-annotator agreement goes up. Every quality measure computed from the annotations improves. Timing is the only signal left.
Actualités, tutoriels et mises à jour de l'équipe Potato.
When annotators accept model pre-labels without reading them, inter-annotator agreement goes up. Every quality measure computed from the annotations improves. Timing is the only signal left.

Potato peut désormais enregistrer comment les annotateurs produisent leurs réponses en texte libre, sans enregistrer ce qu'ils tapent, et transformer les pauses, les révisions et les collages en signalements vérifiables pour les réponses collées plutôt que rédigées.
Un pas-à-pas complet, d'un dossier de sorties Whisper à des tours de parole étiquetés : choisir l'unité d'annotation, gérer la diarisation, écrire la configuration, lancer la tâche et exporter sans perdre l'alignement temporel.



Get notified about new tutorials, releases, and community highlights.
Le vote majoritaire jette l'essentiel de ce que vos annotateurs vous ont dit. La théorie de la réponse à l'item donne à chaque étiquette une probabilité a posteriori et un intervalle de confiance, estime l'aptitude des annotateurs et la difficulté des éléments, et repère les entrées cassées du livre de codes, sans étiquettes étalons ni LLM.
Potato 2.7 ajoute des étiquettes avec barres d'erreur, des salles de normalisation en direct, des sondes contrefactuelles de frontière, la notation par prédiction des pairs, des justifications vocales traitées en local, des rapports de jeu de données en une commande et l'annotation mobile, sans qu'aucune de ces fonctionnalités n'ait besoin d'un LLM. Plus l'évaluation d'agents multi-agents et multimodaux.

Un parcours guidé de l'évaluation humaine des agents computer-use et GUI dans Potato : juger chaque action, vérifier l'ancrage du clic sur la capture d'écran et passer en revue les appels d'outils un par un.
Comment trouver pourquoi un système LLM multi-agents a échoué avec Potato : le graphe d'interaction, l'attribution de l'échec, la revue des passages de relais, les tableaux de bord par agent, la chronologie de contention des outils et l'étiquetage des comportements émergents.

Le temps de relecture humaine est la ressource la plus rare dans l'évaluation des agents. Potato 2.6 associe une file de triage fondée sur des signaux à un alignement juge-humain, pour que les pires traces parviennent d'abord aux humains et que votre juge LLM ne cesse de s'améliorer.
L'identité de l'annotateur façonne les étiquettes sur les tâches subjectives, donc les données démographiques valent la peine d'être recueillies, mais seulement avec consentement et raison. Quoi demander, quoi laisser de côté, et comment mener le flux dans Potato.



Un guide pratique pour décider quand un LLM peut annoter vos données, où les annotateurs modèles échouent, et comment combiner automatisation et vérification humaine dans Potato.
Un regard honnête sur la façon de choisir un outil d'annotation de données open source, les questions qui restreignent réellement le choix, et la place de Potato parmi Label Studio, Prodigy, Doccano, brat et Argilla.



Potato prend désormais en charge l'annotation d'agents de coding, avec rendu des diffs, affichage de la sortie du terminal et schémas de récompense de processus. Importez des traces depuis Claude Code, Aider et SWE-Agent.
Guide pas à pas pour recueillir des signaux de récompense par étape en vue de l'entraînement d'un PRM avec Potato. Couvre le mode première erreur, l'annotation par étape et l'exportation vers les pipelines d'entraînement.




Comparez Potato avec LangSmith, Langfuse, Labelbox et Scale AI pour l'évaluation d'agents : rendu des traces, annotation par étape et multi-agents, revue d'agents multimodaux, agents de coding, observation en direct, tarifs et auto-hébergement.
Mettez en place une évaluation par grille multicritères avec des critères personnalisés, des échelles de notation configurables et des poids par dimension pour évaluer systématiquement les agents IA avec le rubric_eval de Potato.


Comment utiliser l'affichage de traces d'agents web de Potato pour évaluer les agents de navigation web autonomes, avec des captures d'écran étape par étape, des superpositions SVG et des schémas d'annotation par étape.
Potato 2.2.0 ajoute 9 nouveaux schémas d'annotation, un système d'export extensible, l'estimation de compétence MACE, 55 instruments d'enquête validés et des sources de données distantes.


Annotez des documents juridiques dans Potato, contrats, dépôts judiciaires et textes réglementaires, avec étiquetage de spans, extraction d'entités et déploiement auto-hébergé respectueux de la confidentialité.
Bonnes pratiques pour annoter des images médicales dans Potato, affichage DICOM, étiquetage de comptes rendus de radiologie, extraction d'événements indésirables et déploiement auto-hébergé conforme à l'IRB.




Construisez des interfaces de comparaison d'images côte à côte pour le classement de préférences, les tests A/B et l'évaluation de la qualité.
Nous sommes ravis d'annoncer Potato 2.0 avec des fonctionnalités alimentées par l'IA, le support multimédia et des capacités d'apprentissage actif.



Créez des interfaces d'annotation personnalisées avec des modèles HTML, du style CSS et de l'interactivité JavaScript.
Construisez une tâche d'annotation pour l'apprentissage des langues permettant d'évaluer la qualité de la prononciation avec lecture audio et échelles de Likert.




Comment calculer et interpréter le Kappa de Cohen, le Kappa de Fleiss et l'Alpha de Krippendorff pour vos projets d'annotation.
Bonnes pratiques pour assurer la qualité des annotations dans les projets d'annotation, incluant des stratégies pratiques que vous pouvez mettre en œuvre avec et au-delà de Potato.




Un aperçu des concepts d'annotation de suivi multi-objets et de la manière dont les capacités d'annotation vidéo de Potato peuvent supporter des flux de travail de suivi basiques.
Créez une tâche de classification des émotions audio avec affichage de la forme d'onde, contrôles de vitesse de lecture et échelles de Likert.