Audioannotationswerkzeuge im Vergleich: ELAN, Praat, Label Studio und Potato
Vergleich von ELAN, Praat, Label Studio, Prodigy, VIA und Potato für Transkription, Sprecherdiarisierung, Klangereignisse und Annotation in Ebenen, mit Dateiformaten und Übereinstimmung.
Audioannotation versieht Abschnitte einer Aufnahme mit Labels: wer spricht, was gesagt wurde, welches Geräusch auftrat oder wie gut die Aufnahme ist. ELAN und Praat sind die Standardwerkzeuge auf dem Desktop für eine Linguistin oder einen Linguisten, die eine Aufnahme Ebene für Ebene annotieren. Potato, Label Studio und Prodigy laufen im Browser, was Studien entgegenkommt, in denen viele Annotatoren dieselben Aufnahmen labeln. Sie unterscheiden sich darin, ob sie vorhandene Transkripte einlesen und wie sie Übereinstimmung messen.
Die Sprecherdiarisierung teilt eine Aufnahme danach auf, wer spricht. Die Spracherkennung erzeugt ein Transkript, das Annotatoren anschließend korrigieren. Die Klangereigniserkennung markiert, wo ein Geräusch wie eine Sirene oder eine Tür vorkommt. Eine Ebene (Tier) ist in ELAN und Praat eine Schicht von Annotationen über der Zeitachse der Aufnahme, sodass Wörter, Phoneme und Gesten getrennt gelabelt werden können. Der Mean Opinion Score bewertet die wahrgenommene Qualität eines Clips.
Diese Seite behandelt Audio und Sprache. KI-Annotationswerkzeuge im Vergleich behandelt alle Datentypen auf einer Seite.
Welche Audioannotationswerkzeuge lohnen einen Vergleich?
| Werkzeug | Läuft als | Lizenz | Geeignet für |
|---|---|---|---|
| Potato | Web-App | GPL-3.0 | Studien mit mehreren Annotatoren: Segmente, Ebenen, Transkriptkorrektur, Qualitätsbewertungen |
| ELAN | Desktop-App für Windows, macOS und Linux | GPL-3.0 | Zeitlich ausgerichtete Ebenen, mit bis zu vier verknüpften Videodateien und kontrollierten Vokabularen |
| Praat | Desktop-App | Quelloffen | Phonetische Analyse und TextGrid-Annotation |
| Label Studio | Web-App | Apache-2.0 (Community Edition), mit kostenpflichtigen Tarifen | Gelabelte Regionen auf einer Wellenform, Mehrkanal-Audio, Spektrogramme, Transkription |
| Prodigy | Lokal betriebene Web-App | Proprietär | Regionen labeln (audio.manual) und transkribieren (audio.transcribe) |
| VIA 3 | Eine einzelne HTML-Datei, offline im Browser | BSD-2-Clause | Schnelles Segmentlabeling ohne Installation |
Welches Werkzeug für welche Audioaufgabe?
| Aufgabe | Passende Werkzeuge |
|---|---|
| Tonhöhe, Formanten und andere akustische Messungen | Praat |
| Linguistische Annotation in Ebenen durch eine Fachperson | ELAN, Praat |
| ASR-Transkripte mit mehreren Annotatoren korrigieren | Potato, Label Studio |
| Sprecherdiarisierung prüfen | Potato, Label Studio |
| Klangereigniserkennung | Potato, Label Studio, Prodigy |
| Qualitätsbewertungen (MOS) | Potato, Label Studio |
| Verhaltens- oder Gestenkodierung zusammen mit Audio | ELAN, BORIS |
Von einem vorhandenen Transkript ausgehen
Die meisten Sprachprojekte beginnen mit einem Transkript aus Whisper, einer Cloud-API oder einer Untertiteldatei. Potato liest 21 Transkript- und Untertitelformate und zeigt ihre Sprecherwechsel als Sprechblasen, synchron zum Audio, sodass Annotatoren Segmente korrigieren, statt sie neu zu tippen. Zu den Formaten gehören Whisper- und WhisperX-JSON, AWS Transcribe, Deepgram, AssemblyAI, Rev.ai, SubRip, WebVTT, NIST CTM, Praat TextGrid und ELAN EAF. Potato liest keine eigenständigen RTTM-Diarisierungsdateien, kein Transcriber, EXMARaLDA oder CHAT; diese müssen zuerst konvertiert werden. Siehe Transkriptformate.
Seit Version 2.9 kann Potato auch auf dem eigenen Rechner transkribieren und diarisieren, mit faster-whisper und sherpa-onnx, ohne PyTorch und ohne Hugging-Face-Token. Siehe Lokal transkribieren.
In Label Studio und Prodigy wird ein Transkript aus einem anderen System zuerst in das eigene Aufgabenformat des Werkzeugs konvertiert. Das Audio-Tag von Label Studio wird für die Transkription mit einer TextArea kombiniert, und Prodigys Rezept audio.transcribe verbindet die Wiedergabe mit einem Textfeld.
Annotation in Ebenen zwischen ELAN, Praat und Potato austauschen
Potatos Schema tiered_annotation enthält unabhängige und abhängige Ebenen, sodass eine Wortebene eine Äußerungsebene zeitlich unterteilen kann, wie in ELAN. Potato exportiert EAF und TextGrid. Eine Studie kann Annotationen von vielen Personen im Browser sammeln und das Ergebnis an jemanden übergeben, der in ELAN oder Praat arbeitet.
ELAN bleibt das bessere Werkzeug für eine Fachperson, die eine Aufnahme im Detail durcharbeitet, mit synchronisierten Ansichten von bis zu vier Videos. Praat dient der akustischen Analyse, die Potato gar nicht erst versucht.
Übereinstimmung über die Zeit
Zwei Annotatoren, die dasselbe Geräusch markieren, stimmen selten auf die Millisekunde überein. Übereinstimmung bei Audio muss also festlegen, wie nah zwei Grenzen beieinanderliegen müssen, um als dasselbe Ereignis zu gelten.
- ELAN hat eine eingebaute Berechnung der Inter-Annotator-Reliabilität. Sie bietet ein modifiziertes Cohens κ nach Holle und Rein, das Annotationen mit einer festgelegten Mindestüberlappung verknüpft, und den Staccato-Algorithmus, der den Zufall berücksichtigt, indem er eine Segmentierung mit zufällig erzeugten vergleicht. Verglichen werden Paare von Ebenen.
- Potato berichtet die zeitliche IoU für die Überlappung, α für die Lage der Grenzen, α über die Labels und α dafür, ob überhaupt ein Ereignis markiert wurde. Die Toleranz für die Zuordnung wird als Sweep über mehrere Werte gezeigt statt an einem einzigen Schwellenwert. Die Dokumentation nennt eine Einschränkung: Für die Überlappung von Segmenten gibt es noch keine Zufallsbasis. Siehe Übereinstimmung über die Zeit.
- Label Studio behält Übereinstimmungsmaße seinen kostenpflichtigen Tarifen vor.
Eine Audiosegmentierungsaufgabe in Potato
annotation_schemes:
- annotation_type: audio_annotation
name: sound_events
description: "Mark each sound and choose its type."
mode: label
labels:
- {name: speech, color: "#4ECDC4"}
- {name: music, color: "#FF6B6B"}
- {name: noise, color: "#F39C12"}
zoom_enabled: trueAnnotatoren ziehen über die Wellenform, um ein Segment anzulegen, und wählen sein Label. Audioannotation behandelt Klassifikation, Transkription, MOS-Bewertungen und Diarisierung in Potato.
Was Potato bei Audio nicht kann
- Keine akustische Analyse. Tonhöhe, Formanten und spektrale Messungen gehören in Praat.
- Einfachere Werkzeuge für die zeitliche Ausrichtung als ELAN. Die Desktop-Oberfläche von ELAN erlaubt eine feinere Kontrolle.
- Kein Parser für eigenständige RTTM-, Transcriber-, EXMARaLDA- oder CHAT-Dateien.
Geprüft anhand der Dokumentation jedes Projekts im September 2026.
Häufige Fragen
Was ist das beste kostenlose Audioannotationswerkzeug?
ELAN und Praat sind kostenlos und die Standards für linguistische und phonetische Arbeit durch eine einzelne annotierende Person. Für eine Studie, in der mehrere Annotatoren dieselben Aufnahmen im Browser labeln, sind Potato und die Community Edition von Label Studio kostenlos. Potato enthält Übereinstimmungsmaße, die Label Studio seinen kostenpflichtigen Tarifen vorbehält.
Berechnet ELAN die Inter-Annotator-Übereinstimmung?
Ja. Die Reliabilitätsberechnung von ELAN bietet ein modifiziertes Cohens Kappa und den Staccato-Algorithmus und vergleicht Annotationen auf Paaren von Ebenen über mehrere Dateien hinweg.
Kann ich Sprecherdiarisierung im Browser annotieren?
Ja. Potato liest diarisierte Ausgaben von WhisperX, AWS Transcribe, Deepgram, AssemblyAI und Rev.ai, zeigt Sprecherwechsel ohne Sprecher als Unassigned mit einer Auswahl an und kann ab Version 2.9 lokal diarisieren. Auch Label Studio kann Sprecherregionen auf einer Wellenform labeln.
Welche Annotationswerkzeuge lesen Praat-TextGrid- und ELAN-EAF-Dateien?
Praat und ELAN arbeiten in ihren eigenen Formaten. Potato liest und exportiert beide, sodass ein Projekt zwischen einer Browserstudie und einem der beiden Desktop-Werkzeuge wechseln kann.
Muss ich Audio transkribieren, bevor ich es annotiere?
Nur wenn es bei der Annotation um das Gesagte geht. Klangereignisse, Sprecherwechsel und Qualitätsbewertungen lassen sich direkt auf der Wellenform labeln. Für Sprachinhalte sollten Sie von einem vorhandenen Transkript ausgehen, wenn es eines gibt, und von Grund auf transkribieren, wenn das Transkript das Ergebnis ist oder das Audio so schlecht ist, dass die ASR-Ausgabe Annotatoren in die Irre führen würde.
Weiterführende Lektüre
- KI-Annotationswerkzeuge im Vergleich, alle Datentypen auf einer Seite
- Textannotationswerkzeuge im Vergleich
- Bildannotationswerkzeuge im Vergleich
- Videoannotationswerkzeuge im Vergleich
- Werkzeuge zur Evaluation von KI-Agenten im Vergleich
- Werkzeuge zur Evaluation von Weltmodellen und Roboterepisoden im Vergleich
- Whisper-Transkripte annotieren