Skip to content

Strumenti di annotazione audio a confronto: ELAN, Praat, Label Studio e Potato

Confronta ELAN, Praat, Label Studio, Prodigy, VIA e Potato per trascrizione, diarizzazione dei parlanti, eventi sonori e annotazione a livelli, con formati di file e accordo.

L'annotazione audio assegna etichette a tratti di una registrazione: chi parla, cosa ha detto, quale suono si è verificato, o quanto è buona la registrazione. ELAN e Praat sono gli strumenti desktop di riferimento per un linguista che lavora una registrazione livello per livello. Potato, Label Studio e Prodigy funzionano nel browser, il che si adatta agli studi in cui molti annotatori etichettano le stesse registrazioni. Si differenziano nel leggere o meno trascrizioni esistenti e nel modo in cui misurano l'accordo.

La diarizzazione dei parlanti divide una registrazione in base a chi parla. Il riconoscimento vocale produce una trascrizione, che gli annotatori poi correggono. Il rilevamento di eventi sonori segna dove compare un suono, come una sirena o una porta. In ELAN e Praat un livello (tier) è uno strato di annotazioni sulla linea temporale della registrazione, così parole, fonemi e gesti si etichettano separatamente. Il mean opinion score valuta la qualità percepita di una clip.

Questa pagina tratta audio e parlato. Strumenti di annotazione con IA a confronto copre tutti i tipi di dati in una sola pagina.

Quali strumenti di annotazione audio conviene confrontare?

StrumentoFunziona comeLicenzaAdatto a
PotatoApp webGPL-3.0Studi con più annotatori: segmenti, livelli, correzione di trascrizioni, valutazioni di qualità
ELANApp desktop per Windows, macOS e LinuxGPL-3.0Livelli allineati nel tempo, con fino a quattro video collegati e vocabolari controllati
PraatApp desktopOpen sourceAnalisi fonetica e annotazione in TextGrid
Label StudioApp webApache-2.0 (Community Edition), con piani a pagamentoRegioni etichettate su una forma d'onda, audio multicanale, spettrogrammi, trascrizione
ProdigyApp web in localeProprietariaEtichettatura di regioni (audio.manual) e trascrizione (audio.transcribe)
VIA 3Un singolo file HTML, offline nel browserBSD-2-ClauseEtichettatura rapida di segmenti senza installare nulla

Quale strumento per quale compito audio?

CompitoScelte adatte
Altezza, formanti e altre misure acustichePraat
Annotazione linguistica a livelli da parte di uno specialistaELAN, Praat
Correzione di trascrizioni ASR con più annotatoriPotato, Label Studio
Revisione della diarizzazione dei parlantiPotato, Label Studio
Rilevamento di eventi sonoriPotato, Label Studio, Prodigy
Valutazioni di qualità (MOS)Potato, Label Studio
Codifica di comportamenti o gesti insieme all'audioELAN, BORIS

Partire da una trascrizione esistente

La maggior parte dei progetti sul parlato parte da una trascrizione di Whisper, di un'API in cloud o di un file di sottotitoli. Potato legge 21 formati di trascrizione e sottotitoli e mostra i turni come fumetti del parlante sincronizzati con l'audio, così gli annotatori correggono i segmenti invece di scriverli da zero. Tra i formati ci sono il JSON di Whisper e WhisperX, AWS Transcribe, Deepgram, AssemblyAI, Rev.ai, SubRip, WebVTT, NIST CTM, TextGrid di Praat ed EAF di ELAN. Potato non legge file RTTM di diarizzazione da soli, né Transcriber, EXMARaLDA o CHAT, che vanno convertiti prima. Vedi Formati di trascrizione.

Dalla versione 2.9 Potato può anche trascrivere e diarizzare sulla tua macchina, con faster-whisper e sherpa-onnx, senza PyTorch e senza token di Hugging Face. Vedi Trascrivere in locale.

In Label Studio e Prodigy, una trascrizione proveniente da un altro sistema va prima convertita nel formato di attività dello strumento. Il tag Audio di Label Studio si abbina a una TextArea per la trascrizione, e la ricetta audio.transcribe di Prodigy unisce la riproduzione a una casella di testo.

Spostare l'annotazione a livelli tra ELAN, Praat e Potato

Lo schema tiered_annotation di Potato contiene livelli indipendenti e dipendenti, così un livello di parole può suddividere nel tempo un livello di enunciati, come in ELAN. Potato esporta EAF e TextGrid. Uno studio può raccogliere annotazioni da molte persone nel browser e passare il risultato a chi lavora in ELAN o Praat.

ELAN resta lo strumento migliore per un esperto che lavora una registrazione nel dettaglio, con viste sincronizzate di fino a quattro video. Praat serve per l'analisi acustica, che Potato non tenta di fare.

Accordo nel tempo

Due annotatori che segnano lo stesso suono di rado concordano al millisecondo, quindi l'accordo sull'audio deve stabilire quanto vicini devono essere due confini per contare come lo stesso evento.

  • ELAN ha un calcolo integrato dell'affidabilità tra annotatori. Offre una κ di Cohen modificata, secondo Holle e Rein, che collega annotazioni sovrapposte per un minimo stabilito, e l'algoritmo Staccato, che tiene conto del caso confrontando una segmentazione con altre generate a caso. Confronta coppie di livelli.
  • Potato riporta la IoU temporale per la sovrapposizione, α per la posizione dei confini, α sulle etichette e α sull'aver segnato o meno un evento. La tolleranza di abbinamento è mostrata come una scansione su più valori invece che a una sola soglia. La sua documentazione indica un limite: la sovrapposizione dei segmenti non ha ancora una linea di base del caso. Vedi Accordo nel tempo.
  • Label Studio riserva l'accordo ai piani a pagamento.

Un compito di segmentazione audio in Potato

yaml
annotation_schemes:
  - annotation_type: audio_annotation
    name: sound_events
    description: "Mark each sound and choose its type."
    mode: label
    labels:
      - {name: speech, color: "#4ECDC4"}
      - {name: music, color: "#FF6B6B"}
      - {name: noise, color: "#F39C12"}
    zoom_enabled: true

Gli annotatori trascinano sulla forma d'onda per creare un segmento e ne scelgono l'etichetta. Annotazione audio copre classificazione, trascrizione, valutazioni MOS e diarizzazione in Potato.

Cosa non fa Potato con l'audio

  • Nessuna analisi acustica. Altezza, formanti e misure spettrali spettano a Praat.
  • Strumenti di allineamento più semplici di quelli di ELAN. L'interfaccia desktop di ELAN dà un controllo più fine dell'allineamento temporale.
  • Nessun parser per file RTTM, Transcriber, EXMARaLDA o CHAT da soli.

Verificato sulla documentazione di ciascun progetto a settembre 2026.

Domande frequenti

Qual è il miglior strumento gratuito di annotazione audio?

ELAN e Praat sono gratuiti e sono lo standard per il lavoro linguistico e fonetico di un singolo annotatore. Per uno studio in cui più annotatori etichettano le stesse registrazioni nel browser, Potato e la Community Edition di Label Studio sono gratuiti. Potato include metriche di accordo, che Label Studio riserva ai piani a pagamento.

ELAN calcola l'accordo tra annotatori?

Sì. Il calcolo dell'affidabilità di ELAN offre una kappa di Cohen modificata e l'algoritmo Staccato, e confronta le annotazioni su coppie di livelli in più file.

Posso annotare la diarizzazione dei parlanti nel browser?

Sì. Potato legge l'output diarizzato di WhisperX, AWS Transcribe, Deepgram, AssemblyAI e Rev.ai, mostra i turni senza parlante come Unassigned con un selettore e, dalla versione 2.9, può diarizzare in locale. Anche Label Studio può etichettare regioni di parlante su una forma d'onda.

Quali strumenti di annotazione leggono file TextGrid di Praat ed EAF di ELAN?

Praat ed ELAN lavorano nei propri formati. Potato li legge ed esporta entrambi, così un progetto può passare da uno studio nel browser a uno dei due strumenti desktop.

Devo trascrivere l'audio prima di annotarlo?

Solo se l'annotazione riguarda ciò che è stato detto. Eventi sonori, turni di parola e valutazioni di qualità si etichettano direttamente sulla forma d'onda. Per il contenuto parlato, parti da una trascrizione esistente se ce l'hai, e trascrivi da zero quando la trascrizione è il prodotto finale o l'audio è così scadente che l'output ASR fuorvierebbe gli annotatori.

Approfondimenti