Comparatif des outils d'annotation vidéo : CVAT, Label Studio, ELAN, BORIS et Potato
Compare CVAT, Label Studio, ELAN, BORIS, VIA, V7 et Potato pour le suivi d'objets, les segments temporels, le codage du comportement et la propagation de masques, et la façon dont chacun mesure l'accord.
L'annotation vidéo relève le plus souvent de l'un de deux travaux. Le suivi d'objets trace une forme autour de quelque chose et la suit d'une image à l'autre, et CVAT est l'outil open source de référence pour cela. L'annotation temporelle marque le moment où quelque chose se produit, et ELAN et BORIS sont les références en linguistique et en recherche sur le comportement. Potato fait les deux dans le navigateur pour les études à plusieurs annotateurs, et rapporte à quel point ils s'accordent sur le début et la fin des événements.
Le suivi d'objets suit un objet tout au long d'une vidéo, en général en le dessinant sur des images clés et en interpolant les images intermédiaires. Un segment temporel est un début, une fin et une étiquette, comme une action ou un tour de parole. La propagation de masques utilise un modèle pour reporter un masque de segmentation d'une image à la suivante.
Cette page traite de la vidéo. Le comparatif des outils d'annotation par IA couvre tous les types de données sur une seule page.
Quels outils d'annotation vidéo faut-il comparer ?
| Outil | Fonctionne comme | Licence et coût | Adapté à |
|---|---|---|---|
| Potato | Application web auto-hébergée | GPL-3.0, gratuit | Les études à plusieurs annotateurs : suivi, segments temporels, questions par segment, accord |
| CVAT | Auto-hébergé ou hébergé | MIT ; hébergé, 33 $ par utilisateur et par mois | Le suivi de boîtes, de polygones et de points en grand volume |
| Label Studio | Auto-hébergé ou hébergé | Apache-2.0 Community Edition, avec offres payantes | Le suivi d'objets avec VideoRectangle, des étiquettes sur des plages d'images avec TimelineLabels |
| ELAN | Application de bureau | GPL-3.0 | Des niveaux alignés dans le temps sur jusqu'à quatre vidéos liées |
| BORIS | Application de bureau pour Linux, Windows, macOS et Android | GPL-3.0 | Consigner des événements comportementaux en vidéo, en audio ou en observation directe |
| Prodigy | Application web lancée en local | Propriétaire | Des régions horodatées sur une vidéo via ses interfaces audio |
| VIA 3 | Un seul fichier HTML, hors ligne dans le navigateur | BSD-2-Clause | Petits projets vidéo sans rien installer |
| V7, Supervisely | Hébergés ; Supervisely aussi auto-hébergeable | Commercial | Suivi avec propagation de masques par modèle et flux de travail gérés |
Suivre des objets d'une image à l'autre
Le mode piste de CVAT relie des formes de différentes images comme un seul objet. L'annotateur ajuste la forme sur quelques images clés, et CVAT interpole linéairement les images intermédiaires, pour les rectangles, les polygones et les points. La balise VideoRectangle de Label Studio apporte le suivi d'objets à la vidéo, pour les boîtes. V7, Supervisely et Segments.ai suivent avec interpolation et propagent les masques avec un modèle.
Le schéma video_annotation de Potato a un mode de suivi qui interpole boîtes et polygones entre images clés. La propagation de masques avec SAM 2 s'exécute sur le serveur. Le navigateur dispose d'une voie plus légère qui reporte le masque. Voir Annoter le suivi d'objets en vidéo.
Marquer le moment où les choses se produisent
La balise TimelineLabels de Label Studio étiquette une image d'un clic ou une plage d'images en faisant glisser la souris. ELAN rattache les annotations à la ligne de temps sur autant de niveaux que le schéma l'exige, avec des vocabulaires contrôlés et jusqu'à quatre vidéos synchronisées. BORIS consigne et code des événements comportementaux en vidéo, en audio ou en observation directe. Prodigy enregistre des régions d'après les horodatages de la vidéo, et VIA 3 annote la vidéo en plus des images et de l'audio.
Dans Potato, les segments temporels s'étiquettent sur une ligne de temps. Depuis la version 2.9, segment_schemes place n'importe quel type d'annotation dans un segment, si bien que chaque segment peut porter sa propre note ou sa propre question en texte libre. Voir Annotation vidéo.
L'accord sur les annotations vidéo
Deux annotateurs qui marquent le début d'un événement ne choisissent pas la même image, donc l'accord temporel dépend de l'écart autorisé entre deux marques pour qu'elles comptent comme la même.
- ELAN intègre un calcul de fiabilité inter-annotateurs : un κ de Cohen modifié qui relie les annotations se chevauchant d'un minimum fixé, et l'algorithme Staccato, qui tient compte du hasard en comparant une segmentation à des segmentations générées aléatoirement.
- Potato rapporte l'IoU temporelle pour le chevauchement, un α pour la position des limites, un α sur les étiquettes et un α sur le fait qu'un événement a été marqué ou non, avec la tolérance d'appariement présentée comme un balayage de valeurs. Sa documentation signale une limite : le chevauchement de segments n'a pas encore de référence de hasard. Voir L'accord dans le temps.
- Le moteur de consensus de CVAT compare les annotateurs avec l'IoU brute face à un seuil par classe.
Pour les pistes et les masques, Potato compare les masques image par image avec le consensus de masques et STAPLE, et les boîtes avec l'accord géométrique décrit dans Mesurer l'accord inter-annotateurs sur les boîtes englobantes.
Formats
Potato exporte en MOT pour les pistes, en DAVIS pour les masques de segmentation d'objets vidéo, et en EAF pour les annotations alignées dans le temps qu'ELAN ouvre. Voir Formats de vision par ordinateur.
Une tâche de suivi dans Potato
annotation_schemes:
- annotation_type: video_annotation
name: tracks
description: "Draw the object once, then press Track forward."
source_field: video_url
mode: tracking
labels:
- {name: subject, color: "#d1495b"}
tracking_options:
interpolation: linear
auto_advance_frames: 5
video_fps: 12
frame_stepping: trueframe_stepping permet aux annotateurs d'avancer image par image, et auto_advance_frames fixe la longueur du saut de Track forward.
Ce que Potato ne fait pas pour la vidéo
- Pas encore d'attributs par objet. Une piste porte une étiquette. Les indicateurs d'occlusion et de troncature demandent un schéma complémentaire.
- Pas de propagation de masques dans le navigateur. La propagation avec SAM 2 s'exécute sur le serveur.
- Pas d'annotateurs fournis. Amenez les vôtres, ou recrutez-les sur Prolific.
Vérifié dans la documentation de chaque projet en août et septembre 2026.
Questions fréquentes
Quel est le meilleur outil gratuit d'annotation vidéo ?
Pour suivre des objets en grand volume, CVAT est gratuit, mûr et auto-hébergé. Pour coder le comportement ou la parole dans le temps, ELAN et BORIS sont des outils de bureau gratuits. Pour une étude où plusieurs annotateurs étiquettent les mêmes vidéos dans le navigateur et où l'accord doit être rapporté, Potato l'inclut gratuitement.
Quels outils d'annotation vidéo interpolent entre les images clés ?
Le mode piste de CVAT interpole linéairement rectangles, polygones et points entre images clés. Le mode de suivi de Potato interpole boîtes et polygones. V7 et Supervisely interpolent et propagent en plus les masques avec un modèle. VideoRectangle de Label Studio suit des boîtes.
Que faut-il utiliser pour le codage du comportement en vidéo ?
BORIS et ELAN sont les outils gratuits établis, et ELAN peut calculer la fiabilité inter-annotateurs entre paires de niveaux. Pour un schéma de codage appliqué par plusieurs codeurs dans le navigateur, avec l'accord entre eux rapporté, les segments temporels de Potato conviennent.
Comment mesure-t-on l'accord sur les annotations vidéo ?
Pour les événements, appariez les segments de chaque annotateur dans une tolérance et rapportez le chevauchement, l'accord sur les limites et l'accord sur les étiquettes, de préférence pour plusieurs tolérances, car un accord à un quart de seconde et un accord à deux secondes sont des affirmations différentes. Pour les pistes, comparez les formes image par image, avec l'IoU pour les boîtes et les masques.
Où s'exécute la propagation de masques vidéo dans Potato ?
Sur le serveur, avec SAM 2. Le navigateur dispose d'une voie plus légère qui copie un masque sur l'image suivante sans le modèle.
Pour aller plus loin
- Comparatif des outils d'annotation par IA, tous les types de données sur une page
- Comparatif des outils d'annotation de texte
- Comparatif des outils d'annotation audio
- Comparatif des outils d'annotation d'images
- Comparatif des outils d'évaluation d'agents IA
- Comparatif des outils d'évaluation des modèles du monde et des épisodes robotiques
- Annoter le suivi d'objets en vidéo