Skip to content

Comparatif des outils d'annotation par IA : open source et payants

Comparaison de 14 outils et plateformes d'annotation pour le texte, la vision, la 3D et l'évaluation d'agents : lesquels pré-annotent avec de l'IA, et ce que contient vraiment chaque offre gratuite.

Un outil d'annotation est un logiciel qui attache des étiquettes à du texte, des images, de l'audio, de la vidéo ou des sorties de modèle, afin que le résultat puisse entraîner ou évaluer un système. Ce guide compare 14 outils open source et commerciaux sur la couverture des modalités, l'annotation assistée par IA, les métriques d'accord et ce que contient réellement chaque offre gratuite.

Il n'existe pas d'unique meilleur outil. Le bon choix dépend de ce que vous annotez, de votre budget, du besoin éventuel d'évaluer des agents ou des LLM, et du niveau de configuration que vous pouvez accepter.

Quels outils d'annotation devrais-je comparer ?

OutilLicencePoints fortsIdéal quand
PotatoGratuit, open source (recherche)61 types de tâches en texte, image, audio, vidéo, 3D et robotique, évaluation d'agents et de LLM, YAML sans code, métriques d'accord intégréesRecherche, évaluation d'agents/LLM, mise en place rapide sans code
Label StudioOpen source + offres payantesLarge prise en charge des modalités, interface soignée, vaste écosystèmeÉquipes voulant une plateforme à soutien commercial
ProdigyPayant (commercial)Scriptable, axé sur l'apprentissage actif, intégration étroite avec spaCyUtilisateurs de spaCy à l'aise avec un outil payant piloté par le code
DoccanoOpen sourceSimple, épuré, facile à auto-hébergerClassification de texte et NER simples
bratOpen sourceAnnotation mature de texte enrichi et de relationsAnnotation linguistique d'entités et de relations
INCEpTIONOpen sourceAnnotation linguistique riche, liaison avec des bases de connaissancesProjets linguistiques approfondis pouvant investir dans la configuration
ArgillaOpen sourceCentré sur les données pour LLM, intégration avec Hugging FaceCollecte de données de feedback/RLHF dans la pile HF
CVATOpen sourceAnnotation de vision par ordinateur en image/vidéoBoîtes englobantes, masques et étiquetage de vision en vidéo
Labelbox / ScaleCommercial (payant)Plateforme gérée, services avec une importante main-d'œuvreEntreprises achetant l'outillage plus une main-d'œuvre d'étiquetage

(Les détails évoluent avec le temps ; consultez chaque projet pour connaître sa licence et ses fonctionnalités actuelles.)

Ce que la colonne licence cache : ce qu'une offre gratuite contient réellement. L'édition communautaire de Label Studio ne fournit aucune métrique d'accord inter-annotateurs, et le marquage de la vérité terrain et les tableaux de bord qualité commencent à 99 $ par utilisateur et par mois. Prodigy n'a pas d'offre gratuite. CVAT indique que son interface de contrôle qualité est payante. Si vous choisissez sur le contrôle qualité plutôt que sur la couverture des modalités, comparez les éditions gratuites, pas les pages marketing. Nous tenons une matrice de capacités pour onze outils, vérifiée dans leur propre documentation.

Quels outils d'annotation utilisent l'IA pour pré-annoter ?

« Outil d'annotation par IA » recouvre trois capacités que l'on vend en général comme une seule, et un outil qui en possède une manque souvent des autres.

  • Géométrie assistée par modèle. Cliquez ou dessinez grossièrement et un modèle de segmentation resserre le contour. Potato l'exécute dans le navigateur sans GPU ; CVAT y accède via Nuclio ou sa voie d'agents IA ; Label Studio via un backend ML ; Roboflow, V7, Supervisely et Segments.ai l'intègrent au produit.
  • Étiquetage piloté par prompt. Tapez le nom d'un objet et récupérez un masque ou une boîte, au lieu de choisir dans une liste figée. Potato, Roboflow et V7 le prennent en charge. Voir étiqueter des objets en tapant leur nom.
  • Pré-annotation par LLM et VLM. Un modèle propose des étiquettes pour un lot et les annotateurs les relisent. Potato dispose de 13 types de points de terminaison pour cela et peut aussi faire critiquer des annotations terminées par un modèle vision-langage.

La pré-annotation change ce que le contrôle qualité doit repérer. Les annotateurs qui acceptent les suggestions sans les lire font monter tous les chiffres d'accord tout en faisant baisser l'exactitude, et le temps passé est le seul signal qui sépare la relecture du tamponnage. Voir repérer les pré-annotations validées sans relecture.

Potato n'entraîne ni ne sert de modèles. Il ordonne les items, appelle les modèles que vous lui désignez et enregistre ce que l'annotateur a fait du résultat.

Vision, 3D et évaluation de modèles

Les surfaces de vision par ordinateur, spatiales et d'évaluation de Potato sont plus récentes que celles consacrées au texte. Ce tableau indique les points forts de chaque outil plutôt qu'il ne les classe.

CapacitéPotatoCVATLabel StudioRoboflowV7SuperviselySegments.ai
Auto-hébergement gratuitOuiOui (MIT)Éd. communautaire--Éd. communautaire-
Boîtes, polygones, masquesOuiOuiOuiOuiOuiOuiOui
Segmentation interactiveDans le navigateur, sans GPUVia NuclioVia un backend MLOuiOuiOuiOui
Segmentation par invite textuelleOui (dans le navigateur)-Via un backend MLOui (SAM 3)Oui (SAM 3)Via des applications-
Points clés / squelettesOuiOuiOuiOuiOuiOuiOui
Polylignes, ellipses, cuboïdes 2DOuiOuiPartielPartielOuiOuiOui
Attributs par objet-OuiOuiOuiOuiOuiOui
Suivi vidéo avec interpolationOuiOuiPartielPartielOuiOuiOui
Propagation de masques par modèleOui (SAM 2, côté serveur)Via des agents IAVia un backend MLOuiOuiOuiOui
Zoom profond / gigapixelOui (DZI + IIIF)Partiel--OuiOui-
Nuages de points 3D et cuboïdesOuiOui---OuiOui
Séquences de nuages de points-Oui---OuiOui
Fusion de capteurs (2D↔3D)OuiPartiel---OuiOui
Cartes de profondeur avec fenêtrageOui---Partiel--
DICOM / NIfTI / WSI----OuiOui-
Entraînement de modèles dans le même produit-Partiel-OuiOuiOui-
Import de formats de vision15 formatsÉtenduPartielÉtenduPartielÉtenduPartiel
Accord corrigé du hasard sur la géométrieOui------
Épisodes de robots (LeRobot, RLDS, HDF5)Oui------
Évaluation de vidéo générative et de modèles du mondeOui------
Évaluation de l'ancrage et du pointage des VLMOui------

Sur la plupart des lignes, les plateformes de vision matures égalent ou dépassent Potato. Deux méritent une lecture attentive plutôt qu'une simple coche : la segmentation par invite textuelle de Potato s'exécute dans le navigateur avec un modèle sous licence Apache-2.0, là où les équivalents commerciaux s'exécutent côté serveur sous les conditions non commerciales de SAM 3, et sa propagation de masques s'exécute sur le serveur, si bien que l'offre gratuite dispose de la capacité mais pas dans le navigateur. Sur les quatre dernières lignes, Potato fait quelque chose que les autres outils ne proposent pas.

La vision par ordinateur à grand volume

CVAT est la référence des outils de vision open source et reste le meilleur choix pour les chaînes à grand volume dédiées uniquement à la vision : gestion plus fine des tâches et des travaux, attributs par objet, écosystème de formats plus vaste grâce à Datumaro, et communauté très importante. Choisissez Potato quand le travail de vision côtoie des tâches de texte, d'audio ou d'évaluation, ou quand vous avez besoin de l'accord entre annotateurs plutôt que de l'exactitude face à un travail de référence.

Roboflow est excellent si votre objectif est un modèle entraîné : Smart Polygon, étiquetage automatique par lots, Label Assist à partir de votre propre modèle, entraînement et déploiement hébergés dans une même boucle. Potato n'entraîne pas de détecteurs. Choisissez Potato quand les étiquettes elles-mêmes sont le résultat de la recherche et que leur fiabilité doit pouvoir être défendue.

Labelbox, SuperAnnotate, Encord, Kili et V7 sont des plateformes commerciales matures dotées de la gestion de la main-d'œuvre, d'une gouvernance d'entreprise et d'un solide étiquetage assisté par modèle. Si vous avez besoin d'une main-d'œuvre gérée, de certifications de conformité ou d'une curation à l'échelle du pétaoctet, ce sont elles la bonne réponse.

X-AnyLabeling réunit Grounding DINO, Grounded-SAM 2, SAM 2.1 et YOLO dans une application de bureau, et pour une seule personne étiquetant en local avec un large éventail de modèles, il est difficile à battre. Potato propose un ensemble de modèles plus restreint et s'exécute dans le navigateur, donc rien n'est installé sur la machine de l'annotateur ; son avantage commence dès qu'il y a plus d'un annotateur.

Gigapixel et pathologie numérique

Potato construit une pyramide de tuiles servie à la fois en DZI et via l'IIIF Image API 3.0, et les masques au pinceau fonctionnent à la pleine résolution de la source, car le tampon de masque indexe les pixels de l'image et non une texture GPU.

Pour la pathologie numérique en particulier, QuPath (bureau, open source, la référence du domaine) et Cytomine (web, open source, multi-utilisateur avec annotation en aveugle) sont conçus pour cet usage, et Potato ne lit ni SVS, ni DICOM, ni NIfTI. Utilisez Potato ici quand vos images sont grandes mais pas dans un format clinique, ou quand vous avez besoin par-dessus de ses couches d'accord et de flux de travail.

3D et fusion de capteurs

Segments.ai, Kognic, Deepen AI, Supervisely et Xtreme1/BasicAI sont des spécialistes, et pour les chaînes de conduite autonome en production ils ont de l'avance : flux de séquences et d'épisodes avec propagation des pistes, prise en charge du radar et de plusieurs LiDAR, modèles d'ajustement automatique des cuboïdes, ontologies d'attributs par objet et, dans le cas de Deepen, un produit complet de calibration sans mire. Supervisely et Xtreme1 sont tous deux auto-hébergeables, et Supervisely traite des nuages bien plus volumineux.

Choisissez Potato pour la 3D quand vous voulez des statistiques de fiabilité sur des étiquettes spatiales, ou quand la 3D n'est qu'une partie d'une étude multimodale.

Robotique, modèles du monde et ancrage

Pour les épisodes de robots, ATLAS (TU Wien) est un outil de bureau ciblé sur la segmentation d'actions à long horizon, avec une prise en charge native des ROS bag et de RLDS, et il est conçu pour la précision des frontières avec un seul annotateur. ELAN et BORIS restent les standards du codage comportemental, et Rerun et Foxglove sont les meilleurs outils de visualisation en robotique.

Pour la vidéo générative, l'écosystème est surtout fait de benchmarks (VBench, WorldModelBench, Physics-IQ) et de panels de foule pour la collecte de préférences à grande échelle. Ceux-ci fournissent les métriques et les protocoles de référence ; Potato fournit un instrument pour mener la partie humaine de façon répétée avec une fiabilité mesurée, ce qui relève de la complémentarité plutôt que de la concurrence.

Pour l'ancrage des VLM, le domaine est défini par des jeux de données et des harnais d'évaluation (RefCOCO, PixMo-Points, PointBench, lmms-eval, VLMEvalKit) plutôt que par des produits d'annotation. Le rôle de Potato est de collecter et de mesurer la vérité terrain humaine sur laquelle ces benchmarks sont bâtis.

Ce que Potato ne fait pas

Pour qu'une évaluation n'ait pas à le découvrir tardivement :

  • Pas d'entraînement de modèles. Potato ordonne les éléments, pré-étiquette avec des modèles existants et critique les annotations avec un VLM. Il n'entraîne ni ne sert de détecteurs. Roboflow, V7, Supervisely et Labelbox le font.
  • Pas encore d'attributs par objet. La géométrie porte une étiquette ; les niveaux d'occlusion, les indicateurs de troncature et les attributs de sous-type demandent un schéma d'accompagnement.
  • Pas de mode séquence pour les nuages de points. L'annotation 3D se fait image par image ; la propagation des pistes sur un balayage n'est pas implémentée.
  • Pas de DICOM, de NIfTI ni de WSI. Le zoom profond et le fenêtrage 16 bits couvrent les grandes images scientifiques, pas les images cliniques.
  • Pas de main-d'œuvre gérée, ni SAML/SCIM, ni certifications de conformité. Potato est un logiciel que vous exécutez. RBAC et OAuth sont pris en charge ; la gouvernance d'entreprise ne l'est pas.

Nombre de fonctionnalités

CatégoriePotato
Schémas d'annotation61
Types d'affichage24
Formats d'export29
Formats d'import15
Types de point de terminaison IA/LLM13
Types de source de données8
Stratégies d'attribution11
Instruments d'enquête55
Intégrations de crowdsourcing9
Phases de flux de travail8

Ces nombres sont générés à partir des registres de Potato lui-même. Il n'y a pas de colonne « meilleure alternative », car les outils ci-dessus organisent leurs capacités de façon suffisamment différente pour qu'un chiffre unique invite à une comparaison trompeuse.

Comment choisir un outil d'annotation ?

  • Qu'annotez-vous ? Pour du NER en texte seul, Doccano ou brat sont simples. Pour un mélange de texte/image/audio/vidéo, Potato et Label Studio couvrent l'ensemble.
  • Avez-vous besoin d'évaluer des agents ou des LLM ? C'est là que Potato se distingue : il lit des traces d'agents dans de nombreux formats et dispose d'outils conçus spécialement pour l'évaluation de trajectoires, de récompense de processus, d'agents web, d'agents de programmation, d'équipes multi-agents et d'agents d'usage informatique/multimodaux. La plupart des outils généralistes ne le font pas.
  • Budget. Potato, Label Studio (cœur), Doccano, brat et Argilla sont gratuits et open source ; Prodigy et certaines offres de Label Studio sont payants.
  • Effort de configuration. Potato se configure avec un fichier YAML et ne nécessite aucun code ; Prodigy privilégie le code ; les autres se situent entre les deux.
  • Écosystème. Prodigy s'associe à spaCy ; Argilla à Hugging Face ; Potato exporte vers de nombreux formats ML, dont CoNLL, spaCy, Hugging Face et COCO/YOLO.

Quand Potato est-il le bon outil d'annotation ?

Potato est né du TAL académique. Le système initial a été présenté à EMNLP 2022 et Potato 2.0 à ACL 2026, et il est conçu pour l'ensemble du flux de travail de recherche : de nombreux types de tâches, un contrôle qualité et des métriques d'accord prêts à l'emploi, des intégrations de crowdsourcing et un large ensemble d'outils d'évaluation d'agents d'IA. Si votre travail couvre plusieurs modalités ou inclut l'évaluation de LLM et d'agents, il mérite votre attention.

Si vous avez surtout besoin d'une seule tâche de texte avec un produit commercial hébergé, ou si vous travaillez entièrement au sein de spaCy ou de Hugging Face, l'un des autres pourrait mieux vous convenir.

Foire aux questions

Quel est le meilleur outil d'annotation gratuit ?

Cela dépend de la modalité. Pour de la classification et de la NER uniquement textuelles, Doccano et brat demandent le moins de mise en place. Pour du texte, de l'image, de l'audio et de la vidéo dans un même projet, Potato et l'édition communautaire de Label Studio couvrent tous deux l'éventail, et la différence se voit sur le contrôle qualité : Potato inclut les métriques d'accord et les tableaux de bord qualité sans frais, là où Label Studio les place dans une offre payante. Pour de la vision par ordinateur à grand volume, CVAT est gratuit et mature.

Potato est-il une alternative gratuite à Label Studio ?

Oui. Potato est gratuit et open source, et couvre le texte, l'image, l'audio, la vidéo et l'évaluation d'agents/LLM à partir d'une seule configuration YAML, sans code. Label Studio est plus large sur certaines intégrations, mais pousse les équipes vers des offres payantes ; Potato reste gratuit et auto-hébergé, ce qui convient au travail académique et de recherche reproductible.

Potato est-il une alternative gratuite et open source à Prodigy ?

Oui. Prodigy est un excellent outil payant, axé sur le code et étroitement lié à spaCy ; Potato est gratuit, se configure en YAML sans code et exporte vers les formats spaCy, CoNLL et Hugging Face. Si vous voulez de l'apprentissage actif sans licence commerciale, Potato est l'option open source.

Comment Potato se compare-t-il à INCEpTION pour l'annotation linguistique ?

INCEpTION est puissant pour l'annotation linguistique approfondie et la liaison avec des bases de connaissances, mais il est plus lourd à déployer. Potato est plus simple à mettre en place, un fichier YAML et une seule commande, et il est généralement plus rapide pour les tâches de span, de relations et de classification qui n'ont pas besoin de toute la machinerie linguistique d'INCEpTION.

Pourquoi utiliser Potato plutôt qu'une plateforme commerciale comme Labelbox ou Scale AI ?

Labelbox et Scale vendent une plateforme gérée et une main-d'œuvre d'étiquetage, ce qui convient aux entreprises achetant les deux. Pour les équipes de recherche qui apportent leurs propres annotateurs et qui ont besoin que les données restent sur leurs serveurs, Potato est l'alternative gratuite et auto-hébergée, avec des métriques d'accord inter-annotateurs intégrées.

Quel est le meilleur outil open source pour annoter des trajectoires d'agents d'IA ?

C'est là que Potato se distingue parmi les outils d'annotation généralistes : il lit des traces d'agents dans 15 formats et dispose de vues conçues spécialement pour l'évaluation de trajectoires, au niveau de l'étape, d'agents web et d'agents de programmation. Il annote aussi les équipes multi-agents sur un graphe d'interaction cliquable et les agents multimodaux tels que les agents d'usage informatique et vocaux. La plupart des outils, open source ou commerciaux, n'annotent pas du tout les exécutions d'agents.

Que peut évaluer Potato que les outils d'observabilité et les plateformes d'étiquetage ne peuvent pas ?

Deux catégories de surfaces d'annotation d'agents, dont aucune n'apparaît comme une fonctionnalité configurable et auto-hébergée dans les outils habituellement comparés à Potato (LangSmith, Langfuse, Labelbox, Scale AI, Label Studio, Argilla, Braintrust), vérifiées par rapport à leur documentation en juin 2026 :

  • Structure d'équipe multi-agents. Un graphe d'interaction modifiable par l'annotateur (marquer le chemin critique, signaler un mauvais relais), l'attribution des échecs entre agents sous forme de triplet agent responsable / étape décisive / raison, l'examen des relais comme objet de premier ordre, des tableaux de bord par agent et par équipe, une chronologie de la contention des outils et le marquage des comportements émergents. Ce qui s'en rapproche le plus ailleurs, ce sont les « Agent Graphs » de Langfuse, qui constituent une vue de débogage en lecture seule plutôt qu'une surface d'annotation.
  • Agents multimodaux. Des trajectoires d'usage informatique avec un marqueur d'ancrage des clics, des chronologies vocales en duplex intégral avec notation des interruptions (barge-in), et un ancrage temporel de la vidéo avec un IoU en direct par rapport à l'intervalle prédit par le modèle. Scale AI réalise de l'ancrage d'interface graphique et de l'évaluation vocale, mais sous forme de prestations gérées sur des jeux de données, et son arène vocale fonctionne au tour par tour plutôt qu'en duplex intégral.

Les outils d'observabilité (LangSmith, Langfuse, Braintrust) attachent des scores et des commentaires au niveau des spans, ce qui constitue une véritable annotation par étape, mais pas ces surfaces de structure d'agents. Les plateformes d'étiquetage (Labelbox, Scale) proposent des produits de données d'évaluation d'agents, mais sous forme de services cloud payants ou gérés, et non d'un outil que vous auto-hébergez et configurez en YAML. Les capacités évoluent rapidement, ceci reflète donc un instantané de juin 2026 ; le comparatif complet liste les versions vérifiées.

Pour aller plus loin