Comparatif des outils d'annotation d'images : CVAT, Label Studio, Roboflow, V7 et Potato
Compare CVAT, Label Studio, Roboflow, V7, Supervisely, Segments.ai, X-AnyLabeling, VIA et Potato pour les boîtes, la segmentation, les points clés, les images gigapixel et les nuages de points 3D.
Pour l'étiquetage en vision par ordinateur à grande échelle, CVAT est l'outil open source de référence, et Roboflow, V7 et Supervisely ajoutent, en tant que produits commerciaux, l'entraînement de modèles ou des flux de travail gérés. Potato convient quand les étiquettes d'images sont des données de recherche : plusieurs annotateurs étiquettent les mêmes images, et l'étude doit rapporter leur degré d'accord. Il convient aussi quand les images partagent une étude avec du texte, de l'audio ou des sorties de modèles.
Une boîte englobante est le rectangle autour d'un objet. La segmentation d'images attribue des pixels à des objets, sous forme de polygones ou de masques. Les points clés marquent des repères comme les articulations, et un squelette les relie. L'intersection sur l'union (IoU) mesure le chevauchement de deux formes, et la plupart des outils l'utilisent pour comparer les annotateurs.
Cette page traite des images, des lames gigapixel et des nuages de points 3D. Le comparatif des outils d'annotation par IA couvre tous les types de données sur une seule page.
Quels outils d'annotation d'images faut-il comparer ?
| Outil | Fonctionne comme | Coût | Adapté à |
|---|---|---|---|
| Potato | Auto-hébergé (GPL-3.0) | Gratuit | Les études à plusieurs annotateurs qui rapportent l'accord |
| CVAT | Auto-hébergé (MIT) ou hébergé | Gratuit ; hébergé, 33 $ par utilisateur et par mois | Boîtes, masques et suivi vidéo en grand volume |
| Label Studio | Auto-hébergé ou hébergé | Community Edition gratuite ; offres payantes dès 99 $ par mois | Des images dans des projets qui étiquettent aussi du texte, de l'audio ou de la vidéo |
| Roboflow | Hébergé | Commercial | Passer des étiquettes à un détecteur entraîné et déployé |
| V7 | Hébergé | Commercial | Flux gérés, formats d'imagerie médicale, étiquetage assisté par modèle |
| Supervisely | Auto-hébergé ou hébergé | Community Edition ; niveaux commerciaux | Grandes images, 3D et entraînement de modèles dans le même produit |
| Segments.ai | Hébergé | Commercial | Nuages de points 3D et fusion de capteurs |
| X-AnyLabeling | Application de bureau | Gratuit | Une personne qui étiquette en local avec de nombreux modèles |
| VIA | Un seul fichier HTML, hors ligne dans le navigateur | Gratuit (BSD-2-Clause) | Petits projets sans rien installer |
Boîtes, polygones et points clés
Tous ces outils dessinent des boîtes et des polygones. CVAT, Label Studio, Roboflow, V7, Supervisely, Segments.ai et Potato gèrent aussi les points clés avec squelettes. Potato y ajoute les polylignes, les ellipses, les cuboïdes 2D et les masques au pinceau par instance.
Les plateformes de vision par ordinateur mûres rattachent des attributs à chaque objet, comme un niveau d'occlusion, un indicateur de troncature ou un sous-type. Potato ne le fait pas encore. La géométrie y porte une étiquette, et les attributs supplémentaires demandent un schéma complémentaire.
La segmentation aidée par un modèle
La segmentation interactive transforme un clic ou un contour approximatif en masque ajusté. Potato l'exécute dans le navigateur, sans GPU à provisionner. CVAT y accède via des fonctions Nuclio ou sa voie d'agents IA, et Label Studio via un backend ML. Roboflow, V7, Supervisely et Segments.ai l'intègrent au produit.
La segmentation par texte renvoie un masque pour l'objet que vous nommez. Potato l'exécute dans le navigateur avec un modèle sous licence Apache-2.0. Roboflow et V7 utilisent SAM 3 sur leurs serveurs, Supervisely la propose via des applications, et Label Studio via un backend ML. X-AnyLabeling réunit Grounding DINO, Grounded-SAM 2, SAM 2.1 et YOLO dans une application de bureau, et pour une personne qui étiquette en local avec de nombreux modèles, il est difficile à battre. L'avantage de Potato commence dès qu'il y a plus d'un annotateur.
Voir Annoter des masques de segmentation d'images et étiqueter des objets en tapant leur nom.
Images gigapixel et lames de pathologie
Potato construit une pyramide de tuiles servie à la fois en DZI et en IIIF Image API 3.0. Les masques au pinceau fonctionnent à la pleine résolution de la source, parce que le tampon de masque indexe les pixels de l'image et non une texture GPU : il n'y a donc pas de plafond de taille de texture. Les TIFF scientifiques 16 bits reçoivent une fenêtre par percentiles pour que les structures ténues restent visibles. V7 et Supervisely gèrent aussi les très grandes images, et CVAT en partie. Voir Annotation d'images gigapixel avec le zoom profond.
Pour la pathologie numérique, QuPath (application de bureau open source, la référence du domaine) et Cytomine (application web open source avec annotation à l'aveugle multi-utilisateurs) sont faits pour cela. Potato ne lit ni SVS, ni DICOM, ni NIfTI.
Nuages de points 3D
Potato annote des nuages PCD, PLY, LAS, KITTI .bin et .xyz avec des cuboïdes 3D, des points, des polylignes et des segments par point. Il stocke la rotation des cuboïdes sous forme de quaternion, si bien que le tangage et le roulis survivent à un aller-retour, et il compare les cuboïdes avec une IoU 3D orientée exacte. L'annotation se fait image par image.
Segments.ai, Kognic, Deepen AI, Supervisely et Xtreme1/BasicAI sont des spécialistes, en avance pour les chaînes de production de conduite autonome : flux sur des séquences avec propagation des pistes, prise en charge du radar et de plusieurs LiDAR, et cuboïdes ajustés automatiquement. CVAT, Supervisely et Segments.ai gèrent les séquences de nuages de points, ce que Potato ne fait pas. Voir Annoter des nuages de points 3D.
Mesurer l'accord sur les étiquettes d'images
La plupart des outils de vision par ordinateur comparent les annotateurs par chevauchement. Le moteur de consensus de CVAT et l'étape de consensus de V7 comparent les annotateurs avec l'IoU brute face à un seuil par classe, et Label Studio Enterprise liste la correspondance exacte, l'écart numérique, l'IoU et le chevauchement de segments. Aucune de ces mesures ne corrige le hasard, et l'IoU de deux boîtes sur un grand objet est élevée même si les deux sont tracées sans soin.
Potato rapporte l'accord sur la géométrie avec une référence de hasard empirique. Nous n'avons trouvé aucune autre plateforme d'annotation qui rapporte un accord corrigé du hasard sur des étiquettes spatiales. Mesurer l'accord inter-annotateurs sur les boîtes englobantes explique la méthode.
La pré-annotation ajoute un second problème. Les annotateurs qui acceptent les suggestions du modèle sans les vérifier font monter tous les chiffres d'accord tout en faisant baisser l'exactitude. Potato enregistre les temps de tracé, qui distinguent une suggestion relue d'une suggestion validée sans regarder. Voir Détecter les pré-annotations validées sans relecture.
Formats
Potato importe 15 formats de vision par ordinateur, dont 11 en aller-retour. Il exporte en COCO, YOLO, Pascal VOC, CVAT, LabelMe, Cityscapes, KITTI, V7 Darwin, masques PNG, MOT et DAVIS. Voir Formats de vision par ordinateur.
Une tâche de boîtes englobantes avec deux annotateurs par image
agreement_metrics:
enabled: true
annotation_schemes:
- annotation_type: image_annotation
name: objects
description: "Draw a tight box around every vehicle."
source_field: image
tools: [bbox]
labels:
- {name: car, color: "#FF6B6B"}
- {name: truck, color: "#4ECDC4"}
num_annotators_per_item:
default: 2Chaque image est confiée à deux annotateurs, et le tableau de bord d'administration rapporte leur accord sur les boîtes.
Ce que Potato ne fait pas pour les images
- Pas d'entraînement de modèles. Potato pré-annote avec des modèles existants mais n'entraîne pas de détecteurs. Roboflow, V7, Supervisely et Labelbox le font.
- Pas encore d'attributs par objet.
- Pas de séquences de nuages de points. L'annotation 3D se fait image par image.
- Pas de DICOM, de NIfTI ni de formats de lames entières.
- Pas d'annotateurs fournis. Amenez les vôtres, ou recrutez-les sur Prolific.
Vérifié dans la documentation et la page de prix de chaque projet en août et septembre 2026.
Questions fréquentes
Quel est le meilleur outil gratuit d'annotation d'images ?
Pour un gros volume de travail uniquement en vision par ordinateur, CVAT est gratuit, mûr et auto-hébergé. Pour des images dans un projet qui étiquette aussi du texte ou de l'audio, la Community Edition de Label Studio et Potato couvrent tous deux l'éventail. Pour les études où plusieurs annotateurs étiquettent les mêmes images et où l'accord doit être rapporté, Potato l'inclut gratuitement. Pour une poignée d'images sans rien installer, VIA fonctionne depuis un seul fichier HTML.
Existe-t-il une alternative open source à Labelbox ?
CVAT, la Community Edition de Label Studio et Potato sont open source et auto-hébergés. Labelbox vend une plateforme gérée et une main-d'œuvre d'étiquetage. Les outils open source fournissent le logiciel, pas les annotateurs : vous amenez votre propre équipe ou recrutez via une plateforme comme Prolific.
Peut-on faire de la segmentation assistée par modèle sans serveur GPU ?
Oui. Potato exécute la segmentation interactive et par texte dans le navigateur via ONNX Runtime Web, et elle fonctionne sans réseau une fois les poids du modèle présents sur la machine. Sa propagation de masques vidéo avec SAM 2 s'exécute sur le serveur. X-AnyLabeling exécute les modèles en local, sur le poste. CVAT et Label Studio appellent un serveur de modèles.
Comment mesurer l'accord entre annotateurs sur des boîtes englobantes ?
Confiez chaque image à au moins deux annotateurs, appariez leurs boîtes et rapportez un accord qui tient compte du hasard, car l'IoU brute est élevée sur les grands objets quoi que fassent les annotateurs. Le guide sur l'accord pour les boîtes englobantes traite de l'appariement, de la référence de hasard et de ce qu'il faut rapporter.
Quel outil d'annotation utiliser pour les nuages de points 3D ?
Pour des données de conduite en production avec séquences et propagation des pistes, prenez un spécialiste comme Segments.ai, Kognic ou Supervisely, ou CVAT s'il faut de l'open source. Pour des cuboïdes image par image avec des statistiques d'accord, ou quand la 3D n'est qu'une partie d'une étude multimodale, Potato convient.
Pour aller plus loin
- Comparatif des outils d'annotation par IA, tous les types de données sur une page
- Comparatif des outils d'annotation de texte
- Comparatif des outils d'annotation audio
- Comparatif des outils d'annotation vidéo
- Comparatif des outils d'évaluation d'agents IA
- Comparatif des outils d'évaluation des modèles du monde et des épisodes robotiques
- Annotation d'images