Skip to content

Audioannotationswerkzeuge im Vergleich: ELAN, Praat, Label Studio und Potato

Vergleich von ELAN, Praat, Label Studio, Prodigy, VIA und Potato für Transkription, Sprecherdiarisierung, Klangereignisse und Annotation in Ebenen, mit Dateiformaten und Übereinstimmung.

Audioannotation versieht Abschnitte einer Aufnahme mit Labels: wer spricht, was gesagt wurde, welches Geräusch auftrat oder wie gut die Aufnahme ist. ELAN und Praat sind die Standardwerkzeuge auf dem Desktop für eine Linguistin oder einen Linguisten, die eine Aufnahme Ebene für Ebene annotieren. Potato, Label Studio und Prodigy laufen im Browser, was Studien entgegenkommt, in denen viele Annotatoren dieselben Aufnahmen labeln. Sie unterscheiden sich darin, ob sie vorhandene Transkripte einlesen und wie sie Übereinstimmung messen.

Die Sprecherdiarisierung teilt eine Aufnahme danach auf, wer spricht. Die Spracherkennung erzeugt ein Transkript, das Annotatoren anschließend korrigieren. Die Klangereigniserkennung markiert, wo ein Geräusch wie eine Sirene oder eine Tür vorkommt. Eine Ebene (Tier) ist in ELAN und Praat eine Schicht von Annotationen über der Zeitachse der Aufnahme, sodass Wörter, Phoneme und Gesten getrennt gelabelt werden können. Der Mean Opinion Score bewertet die wahrgenommene Qualität eines Clips.

Diese Seite behandelt Audio und Sprache. KI-Annotationswerkzeuge im Vergleich behandelt alle Datentypen auf einer Seite.

Welche Audioannotationswerkzeuge lohnen einen Vergleich?

WerkzeugLäuft alsLizenzGeeignet für
PotatoWeb-AppGPL-3.0Studien mit mehreren Annotatoren: Segmente, Ebenen, Transkriptkorrektur, Qualitätsbewertungen
ELANDesktop-App für Windows, macOS und LinuxGPL-3.0Zeitlich ausgerichtete Ebenen, mit bis zu vier verknüpften Videodateien und kontrollierten Vokabularen
PraatDesktop-AppQuelloffenPhonetische Analyse und TextGrid-Annotation
Label StudioWeb-AppApache-2.0 (Community Edition), mit kostenpflichtigen TarifenGelabelte Regionen auf einer Wellenform, Mehrkanal-Audio, Spektrogramme, Transkription
ProdigyLokal betriebene Web-AppProprietärRegionen labeln (audio.manual) und transkribieren (audio.transcribe)
VIA 3Eine einzelne HTML-Datei, offline im BrowserBSD-2-ClauseSchnelles Segmentlabeling ohne Installation

Welches Werkzeug für welche Audioaufgabe?

AufgabePassende Werkzeuge
Tonhöhe, Formanten und andere akustische MessungenPraat
Linguistische Annotation in Ebenen durch eine FachpersonELAN, Praat
ASR-Transkripte mit mehreren Annotatoren korrigierenPotato, Label Studio
Sprecherdiarisierung prüfenPotato, Label Studio
KlangereigniserkennungPotato, Label Studio, Prodigy
Qualitätsbewertungen (MOS)Potato, Label Studio
Verhaltens- oder Gestenkodierung zusammen mit AudioELAN, BORIS

Von einem vorhandenen Transkript ausgehen

Die meisten Sprachprojekte beginnen mit einem Transkript aus Whisper, einer Cloud-API oder einer Untertiteldatei. Potato liest 21 Transkript- und Untertitelformate und zeigt ihre Sprecherwechsel als Sprechblasen, synchron zum Audio, sodass Annotatoren Segmente korrigieren, statt sie neu zu tippen. Zu den Formaten gehören Whisper- und WhisperX-JSON, AWS Transcribe, Deepgram, AssemblyAI, Rev.ai, SubRip, WebVTT, NIST CTM, Praat TextGrid und ELAN EAF. Potato liest keine eigenständigen RTTM-Diarisierungsdateien, kein Transcriber, EXMARaLDA oder CHAT; diese müssen zuerst konvertiert werden. Siehe Transkriptformate.

Seit Version 2.9 kann Potato auch auf dem eigenen Rechner transkribieren und diarisieren, mit faster-whisper und sherpa-onnx, ohne PyTorch und ohne Hugging-Face-Token. Siehe Lokal transkribieren.

In Label Studio und Prodigy wird ein Transkript aus einem anderen System zuerst in das eigene Aufgabenformat des Werkzeugs konvertiert. Das Audio-Tag von Label Studio wird für die Transkription mit einer TextArea kombiniert, und Prodigys Rezept audio.transcribe verbindet die Wiedergabe mit einem Textfeld.

Annotation in Ebenen zwischen ELAN, Praat und Potato austauschen

Potatos Schema tiered_annotation enthält unabhängige und abhängige Ebenen, sodass eine Wortebene eine Äußerungsebene zeitlich unterteilen kann, wie in ELAN. Potato exportiert EAF und TextGrid. Eine Studie kann Annotationen von vielen Personen im Browser sammeln und das Ergebnis an jemanden übergeben, der in ELAN oder Praat arbeitet.

ELAN bleibt das bessere Werkzeug für eine Fachperson, die eine Aufnahme im Detail durcharbeitet, mit synchronisierten Ansichten von bis zu vier Videos. Praat dient der akustischen Analyse, die Potato gar nicht erst versucht.

Übereinstimmung über die Zeit

Zwei Annotatoren, die dasselbe Geräusch markieren, stimmen selten auf die Millisekunde überein. Übereinstimmung bei Audio muss also festlegen, wie nah zwei Grenzen beieinanderliegen müssen, um als dasselbe Ereignis zu gelten.

  • ELAN hat eine eingebaute Berechnung der Inter-Annotator-Reliabilität. Sie bietet ein modifiziertes Cohens κ nach Holle und Rein, das Annotationen mit einer festgelegten Mindestüberlappung verknüpft, und den Staccato-Algorithmus, der den Zufall berücksichtigt, indem er eine Segmentierung mit zufällig erzeugten vergleicht. Verglichen werden Paare von Ebenen.
  • Potato berichtet die zeitliche IoU für die Überlappung, α für die Lage der Grenzen, α über die Labels und α dafür, ob überhaupt ein Ereignis markiert wurde. Die Toleranz für die Zuordnung wird als Sweep über mehrere Werte gezeigt statt an einem einzigen Schwellenwert. Die Dokumentation nennt eine Einschränkung: Für die Überlappung von Segmenten gibt es noch keine Zufallsbasis. Siehe Übereinstimmung über die Zeit.
  • Label Studio behält Übereinstimmungsmaße seinen kostenpflichtigen Tarifen vor.

Eine Audiosegmentierungsaufgabe in Potato

yaml
annotation_schemes:
  - annotation_type: audio_annotation
    name: sound_events
    description: "Mark each sound and choose its type."
    mode: label
    labels:
      - {name: speech, color: "#4ECDC4"}
      - {name: music, color: "#FF6B6B"}
      - {name: noise, color: "#F39C12"}
    zoom_enabled: true

Annotatoren ziehen über die Wellenform, um ein Segment anzulegen, und wählen sein Label. Audioannotation behandelt Klassifikation, Transkription, MOS-Bewertungen und Diarisierung in Potato.

Was Potato bei Audio nicht kann

  • Keine akustische Analyse. Tonhöhe, Formanten und spektrale Messungen gehören in Praat.
  • Einfachere Werkzeuge für die zeitliche Ausrichtung als ELAN. Die Desktop-Oberfläche von ELAN erlaubt eine feinere Kontrolle.
  • Kein Parser für eigenständige RTTM-, Transcriber-, EXMARaLDA- oder CHAT-Dateien.

Geprüft anhand der Dokumentation jedes Projekts im September 2026.

Häufige Fragen

Was ist das beste kostenlose Audioannotationswerkzeug?

ELAN und Praat sind kostenlos und die Standards für linguistische und phonetische Arbeit durch eine einzelne annotierende Person. Für eine Studie, in der mehrere Annotatoren dieselben Aufnahmen im Browser labeln, sind Potato und die Community Edition von Label Studio kostenlos. Potato enthält Übereinstimmungsmaße, die Label Studio seinen kostenpflichtigen Tarifen vorbehält.

Berechnet ELAN die Inter-Annotator-Übereinstimmung?

Ja. Die Reliabilitätsberechnung von ELAN bietet ein modifiziertes Cohens Kappa und den Staccato-Algorithmus und vergleicht Annotationen auf Paaren von Ebenen über mehrere Dateien hinweg.

Kann ich Sprecherdiarisierung im Browser annotieren?

Ja. Potato liest diarisierte Ausgaben von WhisperX, AWS Transcribe, Deepgram, AssemblyAI und Rev.ai, zeigt Sprecherwechsel ohne Sprecher als Unassigned mit einer Auswahl an und kann ab Version 2.9 lokal diarisieren. Auch Label Studio kann Sprecherregionen auf einer Wellenform labeln.

Welche Annotationswerkzeuge lesen Praat-TextGrid- und ELAN-EAF-Dateien?

Praat und ELAN arbeiten in ihren eigenen Formaten. Potato liest und exportiert beide, sodass ein Projekt zwischen einer Browserstudie und einem der beiden Desktop-Werkzeuge wechseln kann.

Muss ich Audio transkribieren, bevor ich es annotiere?

Nur wenn es bei der Annotation um das Gesagte geht. Klangereignisse, Sprecherwechsel und Qualitätsbewertungen lassen sich direkt auf der Wellenform labeln. Für Sprachinhalte sollten Sie von einem vorhandenen Transkript ausgehen, wenn es eines gibt, und von Grund auf transkribieren, wenn das Transkript das Ergebnis ist oder das Audio so schlecht ist, dass die ASR-Ausgabe Annotatoren in die Irre führen würde.

Weiterführende Lektüre