Skip to content

Comparatif des outils d'annotation vidéo : CVAT, Label Studio, ELAN, BORIS et Potato

Compare CVAT, Label Studio, ELAN, BORIS, VIA, V7 et Potato pour le suivi d'objets, les segments temporels, le codage du comportement et la propagation de masques, et la façon dont chacun mesure l'accord.

L'annotation vidéo relève le plus souvent de l'un de deux travaux. Le suivi d'objets trace une forme autour de quelque chose et la suit d'une image à l'autre, et CVAT est l'outil open source de référence pour cela. L'annotation temporelle marque le moment où quelque chose se produit, et ELAN et BORIS sont les références en linguistique et en recherche sur le comportement. Potato fait les deux dans le navigateur pour les études à plusieurs annotateurs, et rapporte à quel point ils s'accordent sur le début et la fin des événements.

Le suivi d'objets suit un objet tout au long d'une vidéo, en général en le dessinant sur des images clés et en interpolant les images intermédiaires. Un segment temporel est un début, une fin et une étiquette, comme une action ou un tour de parole. La propagation de masques utilise un modèle pour reporter un masque de segmentation d'une image à la suivante.

Cette page traite de la vidéo. Le comparatif des outils d'annotation par IA couvre tous les types de données sur une seule page.

Quels outils d'annotation vidéo faut-il comparer ?

OutilFonctionne commeLicence et coûtAdapté à
PotatoApplication web auto-hébergéeGPL-3.0, gratuitLes études à plusieurs annotateurs : suivi, segments temporels, questions par segment, accord
CVATAuto-hébergé ou hébergéMIT ; hébergé, 33 $ par utilisateur et par moisLe suivi de boîtes, de polygones et de points en grand volume
Label StudioAuto-hébergé ou hébergéApache-2.0 Community Edition, avec offres payantesLe suivi d'objets avec VideoRectangle, des étiquettes sur des plages d'images avec TimelineLabels
ELANApplication de bureauGPL-3.0Des niveaux alignés dans le temps sur jusqu'à quatre vidéos liées
BORISApplication de bureau pour Linux, Windows, macOS et AndroidGPL-3.0Consigner des événements comportementaux en vidéo, en audio ou en observation directe
ProdigyApplication web lancée en localPropriétaireDes régions horodatées sur une vidéo via ses interfaces audio
VIA 3Un seul fichier HTML, hors ligne dans le navigateurBSD-2-ClausePetits projets vidéo sans rien installer
V7, SuperviselyHébergés ; Supervisely aussi auto-hébergeableCommercialSuivi avec propagation de masques par modèle et flux de travail gérés

Suivre des objets d'une image à l'autre

Le mode piste de CVAT relie des formes de différentes images comme un seul objet. L'annotateur ajuste la forme sur quelques images clés, et CVAT interpole linéairement les images intermédiaires, pour les rectangles, les polygones et les points. La balise VideoRectangle de Label Studio apporte le suivi d'objets à la vidéo, pour les boîtes. V7, Supervisely et Segments.ai suivent avec interpolation et propagent les masques avec un modèle.

Le schéma video_annotation de Potato a un mode de suivi qui interpole boîtes et polygones entre images clés. La propagation de masques avec SAM 2 s'exécute sur le serveur. Le navigateur dispose d'une voie plus légère qui reporte le masque. Voir Annoter le suivi d'objets en vidéo.

Marquer le moment où les choses se produisent

La balise TimelineLabels de Label Studio étiquette une image d'un clic ou une plage d'images en faisant glisser la souris. ELAN rattache les annotations à la ligne de temps sur autant de niveaux que le schéma l'exige, avec des vocabulaires contrôlés et jusqu'à quatre vidéos synchronisées. BORIS consigne et code des événements comportementaux en vidéo, en audio ou en observation directe. Prodigy enregistre des régions d'après les horodatages de la vidéo, et VIA 3 annote la vidéo en plus des images et de l'audio.

Dans Potato, les segments temporels s'étiquettent sur une ligne de temps. Depuis la version 2.9, segment_schemes place n'importe quel type d'annotation dans un segment, si bien que chaque segment peut porter sa propre note ou sa propre question en texte libre. Voir Annotation vidéo.

L'accord sur les annotations vidéo

Deux annotateurs qui marquent le début d'un événement ne choisissent pas la même image, donc l'accord temporel dépend de l'écart autorisé entre deux marques pour qu'elles comptent comme la même.

  • ELAN intègre un calcul de fiabilité inter-annotateurs : un κ de Cohen modifié qui relie les annotations se chevauchant d'un minimum fixé, et l'algorithme Staccato, qui tient compte du hasard en comparant une segmentation à des segmentations générées aléatoirement.
  • Potato rapporte l'IoU temporelle pour le chevauchement, un α pour la position des limites, un α sur les étiquettes et un α sur le fait qu'un événement a été marqué ou non, avec la tolérance d'appariement présentée comme un balayage de valeurs. Sa documentation signale une limite : le chevauchement de segments n'a pas encore de référence de hasard. Voir L'accord dans le temps.
  • Le moteur de consensus de CVAT compare les annotateurs avec l'IoU brute face à un seuil par classe.

Pour les pistes et les masques, Potato compare les masques image par image avec le consensus de masques et STAPLE, et les boîtes avec l'accord géométrique décrit dans Mesurer l'accord inter-annotateurs sur les boîtes englobantes.

Formats

Potato exporte en MOT pour les pistes, en DAVIS pour les masques de segmentation d'objets vidéo, et en EAF pour les annotations alignées dans le temps qu'ELAN ouvre. Voir Formats de vision par ordinateur.

Une tâche de suivi dans Potato

yaml
annotation_schemes:
  - annotation_type: video_annotation
    name: tracks
    description: "Draw the object once, then press Track forward."
    source_field: video_url
    mode: tracking
    labels:
      - {name: subject, color: "#d1495b"}
    tracking_options:
      interpolation: linear
      auto_advance_frames: 5
    video_fps: 12
    frame_stepping: true

frame_stepping permet aux annotateurs d'avancer image par image, et auto_advance_frames fixe la longueur du saut de Track forward.

Ce que Potato ne fait pas pour la vidéo

  • Pas encore d'attributs par objet. Une piste porte une étiquette. Les indicateurs d'occlusion et de troncature demandent un schéma complémentaire.
  • Pas de propagation de masques dans le navigateur. La propagation avec SAM 2 s'exécute sur le serveur.
  • Pas d'annotateurs fournis. Amenez les vôtres, ou recrutez-les sur Prolific.

Vérifié dans la documentation de chaque projet en août et septembre 2026.

Questions fréquentes

Quel est le meilleur outil gratuit d'annotation vidéo ?

Pour suivre des objets en grand volume, CVAT est gratuit, mûr et auto-hébergé. Pour coder le comportement ou la parole dans le temps, ELAN et BORIS sont des outils de bureau gratuits. Pour une étude où plusieurs annotateurs étiquettent les mêmes vidéos dans le navigateur et où l'accord doit être rapporté, Potato l'inclut gratuitement.

Quels outils d'annotation vidéo interpolent entre les images clés ?

Le mode piste de CVAT interpole linéairement rectangles, polygones et points entre images clés. Le mode de suivi de Potato interpole boîtes et polygones. V7 et Supervisely interpolent et propagent en plus les masques avec un modèle. VideoRectangle de Label Studio suit des boîtes.

Que faut-il utiliser pour le codage du comportement en vidéo ?

BORIS et ELAN sont les outils gratuits établis, et ELAN peut calculer la fiabilité inter-annotateurs entre paires de niveaux. Pour un schéma de codage appliqué par plusieurs codeurs dans le navigateur, avec l'accord entre eux rapporté, les segments temporels de Potato conviennent.

Comment mesure-t-on l'accord sur les annotations vidéo ?

Pour les événements, appariez les segments de chaque annotateur dans une tolérance et rapportez le chevauchement, l'accord sur les limites et l'accord sur les étiquettes, de préférence pour plusieurs tolérances, car un accord à un quart de seconde et un accord à deux secondes sont des affirmations différentes. Pour les pistes, comparez les formes image par image, avec l'IoU pour les boîtes et les masques.

Où s'exécute la propagation de masques vidéo dans Potato ?

Sur le serveur, avec SAM 2. Le navigateur dispose d'une voie plus légère qui copie un masque sur l'image suivante sans le modèle.

Pour aller plus loin