Comparatif des outils d'annotation audio : ELAN, Praat, Label Studio et Potato
Compare ELAN, Praat, Label Studio, Prodigy, VIA et Potato pour la transcription, la diarisation, les événements sonores et l'annotation par niveaux, avec les formats de fichier et l'accord.
L'annotation audio attache des étiquettes à des portions d'un enregistrement : qui parle, ce qui a été dit, quel son s'est produit, ou quelle est la qualité de l'enregistrement. ELAN et Praat sont les outils de bureau de référence pour un linguiste qui travaille un enregistrement niveau par niveau. Potato, Label Studio et Prodigy fonctionnent dans le navigateur, ce qui convient aux études où de nombreux annotateurs étiquettent les mêmes enregistrements. Ils diffèrent sur la lecture de transcriptions existantes et sur la mesure de l'accord.
La diarisation découpe un enregistrement selon qui parle. La reconnaissance de la parole produit une transcription que les annotateurs corrigent ensuite. La détection d'événements sonores marque où un son, comme une sirène ou une porte, se produit. Dans ELAN et Praat, un niveau (tier) est une couche d'annotations sur la ligne de temps de l'enregistrement, pour étiqueter séparément les mots, les phonèmes et les gestes. Le mean opinion score note la qualité perçue d'un extrait.
Cette page traite de l'audio et de la parole. Le comparatif des outils d'annotation par IA couvre tous les types de données sur une seule page.
Quels outils d'annotation audio faut-il comparer ?
| Outil | Fonctionne comme | Licence | Adapté à |
|---|---|---|---|
| Potato | Application web | GPL-3.0 | Les études à plusieurs annotateurs : segments, niveaux, correction de transcriptions, notes de qualité |
| ELAN | Application de bureau pour Windows, macOS et Linux | GPL-3.0 | Des niveaux alignés dans le temps, avec jusqu'à quatre vidéos liées et des vocabulaires contrôlés |
| Praat | Application de bureau | Open source | L'analyse phonétique et l'annotation en TextGrid |
| Label Studio | Application web | Apache-2.0 (Community Edition), avec offres payantes | Des régions étiquetées sur une forme d'onde, l'audio multicanal, les spectrogrammes, la transcription |
| Prodigy | Application web lancée en local | Propriétaire | L'étiquetage de régions (audio.manual) et la transcription (audio.transcribe) |
| VIA 3 | Un seul fichier HTML, hors ligne dans le navigateur | BSD-2-Clause | Un étiquetage rapide de segments, sans rien installer |
Quel outil pour quelle tâche audio ?
| Tâche | Outils adaptés |
|---|---|
| Hauteur, formants et autres mesures acoustiques | Praat |
| Annotation linguistique par niveaux par un spécialiste | ELAN, Praat |
| Correction de transcriptions ASR à plusieurs annotateurs | Potato, Label Studio |
| Relecture de la diarisation | Potato, Label Studio |
| Détection d'événements sonores | Potato, Label Studio, Prodigy |
| Notes de qualité (MOS) | Potato, Label Studio |
| Codage du comportement ou des gestes avec l'audio | ELAN, BORIS |
Partir d'une transcription existante
La plupart des projets sur la parole commencent avec une transcription issue de Whisper, d'une API cloud ou d'un fichier de sous-titres. Potato lit 21 formats de transcription et de sous-titres et affiche les tours de parole sous forme de bulles synchronisées avec l'audio, si bien que les annotateurs corrigent des segments au lieu de les saisir de zéro. Parmi les formats : le JSON de Whisper et de WhisperX, AWS Transcribe, Deepgram, AssemblyAI, Rev.ai, SubRip, WebVTT, NIST CTM, le TextGrid de Praat et l'EAF d'ELAN. Potato ne lit pas les fichiers RTTM de diarisation seuls, ni Transcriber, EXMARaLDA ou CHAT, qu'il faut d'abord convertir. Voir Formats de transcription.
Depuis la version 2.9, Potato peut aussi transcrire et diariser sur votre propre machine, avec faster-whisper et sherpa-onnx, sans PyTorch ni jeton Hugging Face. Voir Transcrire en local.
Dans Label Studio et Prodigy, une transcription issue d'un autre système est d'abord convertie au format de tâche propre à l'outil. La balise Audio de Label Studio s'associe à une TextArea pour la transcription, et la recette audio.transcribe de Prodigy combine la lecture et un champ de texte.
Faire circuler l'annotation par niveaux entre ELAN, Praat et Potato
Le schéma tiered_annotation de Potato gère des niveaux indépendants et dépendants, de sorte qu'un niveau de mots peut subdiviser dans le temps un niveau d'énoncés, comme dans ELAN. Potato exporte en EAF et en TextGrid. Une étude peut recueillir les annotations de nombreuses personnes dans le navigateur, puis confier le résultat à quelqu'un qui travaille dans ELAN ou Praat.
ELAN reste le meilleur outil pour un expert qui travaille un enregistrement en détail, avec des vues synchronisées de jusqu'à quatre vidéos. Praat sert à l'analyse acoustique, que Potato ne cherche pas à faire.
L'accord dans le temps
Deux annotateurs qui marquent le même son s'accordent rarement à la milliseconde près. L'accord sur l'audio doit donc fixer à quelle distance deux limites peuvent être pour compter comme le même événement.
- ELAN intègre un calcul de fiabilité inter-annotateurs. Il propose un κ de Cohen modifié, d'après Holle et Rein, qui relie les annotations se chevauchant d'un minimum fixé, et l'algorithme Staccato, qui tient compte du hasard en comparant une segmentation à des segmentations générées aléatoirement. Il compare des paires de niveaux.
- Potato rapporte l'IoU temporelle pour le chevauchement, un α pour la position des limites, un α sur les étiquettes et un α sur le fait qu'un événement a été marqué ou non. La tolérance d'appariement est présentée comme un balayage de valeurs plutôt qu'à un seuil unique. Sa documentation signale une limite : le chevauchement de segments n'a pas encore de référence de hasard. Voir L'accord dans le temps.
- Label Studio réserve l'accord à ses offres payantes.
Une tâche de segmentation audio dans Potato
annotation_schemes:
- annotation_type: audio_annotation
name: sound_events
description: "Mark each sound and choose its type."
mode: label
labels:
- {name: speech, color: "#4ECDC4"}
- {name: music, color: "#FF6B6B"}
- {name: noise, color: "#F39C12"}
zoom_enabled: trueLes annotateurs font glisser la souris sur la forme d'onde pour créer un segment, puis choisissent son étiquette. Annotation audio couvre la classification, la transcription, les notes MOS et la diarisation dans Potato.
Ce que Potato ne fait pas pour l'audio
- Pas d'analyse acoustique. La hauteur, les formants et les mesures spectrales relèvent de Praat.
- Des outils d'alignement plus simples que ceux d'ELAN. L'interface de bureau d'ELAN offre un contrôle plus fin de l'alignement temporel.
- Pas d'analyseur pour les fichiers RTTM, Transcriber, EXMARaLDA ou CHAT seuls.
Vérifié dans la documentation de chaque projet en septembre 2026.
Questions fréquentes
Quel est le meilleur outil gratuit d'annotation audio ?
ELAN et Praat sont gratuits et font référence pour le travail linguistique et phonétique d'un annotateur seul. Pour une étude où plusieurs annotateurs étiquettent les mêmes enregistrements dans le navigateur, Potato et la Community Edition de Label Studio sont gratuits. Potato inclut des mesures d'accord, que Label Studio réserve à ses offres payantes.
ELAN calcule-t-il l'accord inter-annotateurs ?
Oui. Le calcul de fiabilité d'ELAN propose un kappa de Cohen modifié et l'algorithme Staccato, et compare les annotations sur des paires de niveaux, dans plusieurs fichiers.
Peut-on annoter la diarisation dans un navigateur ?
Oui. Potato lit les sorties diarisées de WhisperX, AWS Transcribe, Deepgram, AssemblyAI et Rev.ai, affiche les tours sans locuteur comme Unassigned avec un sélecteur et, depuis la version 2.9, peut diariser en local. Label Studio peut aussi étiqueter des régions de locuteur sur une forme d'onde.
Quels outils d'annotation lisent les fichiers TextGrid de Praat et EAF d'ELAN ?
Praat et ELAN travaillent dans leurs propres formats. Potato lit et exporte les deux, si bien qu'un projet peut passer d'une étude dans le navigateur à l'un ou l'autre outil de bureau.
Faut-il transcrire l'audio avant de l'annoter ?
Seulement si l'annotation porte sur ce qui a été dit. Les événements sonores, les tours de parole et les notes de qualité s'étiquettent directement sur la forme d'onde. Pour le contenu parlé, partez d'une transcription existante si vous en avez une, et transcrivez de zéro quand la transcription est le livrable ou que l'audio est assez mauvais pour que la sortie ASR induise les annotateurs en erreur.
Pour aller plus loin
- Comparatif des outils d'annotation par IA, tous les types de données sur une page
- Comparatif des outils d'annotation de texte
- Comparatif des outils d'annotation d'images
- Comparatif des outils d'annotation vidéo
- Comparatif des outils d'évaluation d'agents IA
- Comparatif des outils d'évaluation des modèles du monde et des épisodes robotiques
- Annoter des transcriptions Whisper