Skip to content

Ferramentas de anotação de áudio comparadas: ELAN, Praat, Label Studio e Potato

Compara ELAN, Praat, Label Studio, Prodigy, VIA e Potato para transcrição, diarização de falantes, eventos sonoros e anotação em camadas, com formatos de ficheiro e concordância.

A anotação de áudio atribui rótulos a trechos de uma gravação: quem fala, o que disse, que som ocorreu ou qual a qualidade da gravação. O ELAN e o Praat são as ferramentas de secretária de referência para um linguista que trabalha uma gravação camada a camada. O Potato, o Label Studio e o Prodigy correm no navegador, o que serve estudos em que muitos anotadores rotulam as mesmas gravações. Diferem em ler ou não transcrições existentes e na forma de medir a concordância.

A diarização de falantes divide uma gravação consoante quem fala. O reconhecimento de fala produz uma transcrição, que os anotadores depois corrigem. A deteção de eventos sonoros marca onde ocorre um som, como uma sirene ou uma porta. No ELAN e no Praat, uma camada (tier) é um nível de anotações sobre a linha temporal da gravação, para que palavras, fonemas e gestos sejam rotulados em separado. O mean opinion score classifica a qualidade percebida de um clip.

Esta página trata de áudio e fala. Ferramentas de anotação com IA, comparadas cobre todos os tipos de dados numa só página.

Que ferramentas de anotação de áudio vale a pena comparar?

FerramentaCorre comoLicençaIndicada para
PotatoAplicação webGPL-3.0Estudos com vários anotadores: segmentos, camadas, correção de transcrições, classificações de qualidade
ELANAplicação de secretária para Windows, macOS e LinuxGPL-3.0Camadas alinhadas no tempo, com até quatro vídeos ligados e vocabulários controlados
PraatAplicação de secretáriaCódigo abertoAnálise fonética e anotação em TextGrid
Label StudioAplicação webApache-2.0 (Community Edition), com planos pagosRegiões rotuladas numa forma de onda, áudio multicanal, espectrogramas, transcrição
ProdigyAplicação web localProprietáriaRotulagem de regiões (audio.manual) e transcrição (audio.transcribe)
VIA 3Um único ficheiro HTML, offline no navegadorBSD-2-ClauseRotulagem rápida de segmentos sem instalar nada

Que ferramenta para cada tarefa de áudio?

TarefaBoas opções
Altura, formantes e outras medidas acústicasPraat
Anotação linguística em camadas por um especialistaELAN, Praat
Corrigir transcrições de ASR com vários anotadoresPotato, Label Studio
Rever a diarização de falantesPotato, Label Studio
Deteção de eventos sonorosPotato, Label Studio, Prodigy
Classificações de qualidade (MOS)Potato, Label Studio
Codificação de comportamento ou gestos a par do áudioELAN, BORIS

Partir de uma transcrição existente

A maioria dos projetos de fala começa com uma transcrição do Whisper, de uma API na nuvem ou de um ficheiro de legendas. O Potato lê 21 formatos de transcrição e legendas e mostra os turnos como balões de falante sincronizados com o áudio, para que os anotadores corrijam segmentos em vez de os escreverem de raiz. Os formatos incluem o JSON do Whisper e do WhisperX, AWS Transcribe, Deepgram, AssemblyAI, Rev.ai, SubRip, WebVTT, NIST CTM, TextGrid do Praat e EAF do ELAN. O Potato não lê ficheiros RTTM de diarização isolados, nem Transcriber, EXMARaLDA ou CHAT, que têm de ser convertidos primeiro. Veja Formatos de transcrição.

Desde a versão 2.9, o Potato também pode transcrever e fazer a diarização na sua própria máquina, com faster-whisper e sherpa-onnx, sem PyTorch e sem token do Hugging Face. Veja Transcrever localmente.

No Label Studio e no Prodigy, uma transcrição de outro sistema é primeiro convertida para o formato de tarefas próprio da ferramenta. A tag Audio do Label Studio combina-se com uma TextArea para transcrição, e a receita audio.transcribe do Prodigy junta a reprodução a uma caixa de texto.

Mover anotação em camadas entre o ELAN, o Praat e o Potato

O esquema tiered_annotation do Potato tem camadas independentes e dependentes, pelo que uma camada de palavras pode subdividir no tempo uma camada de enunciados, como no ELAN. O Potato exporta EAF e TextGrid. Um estudo pode recolher anotações de muitas pessoas no navegador e entregar o resultado a quem trabalha no ELAN ou no Praat.

O ELAN continua a ser a melhor ferramenta para um especialista trabalhar uma gravação em pormenor, com vistas sincronizadas de até quatro vídeos. O Praat serve para análise acústica, que o Potato não tenta fazer.

Concordância ao longo do tempo

Dois anotadores que marcam o mesmo som raramente concordam ao milissegundo, por isso a concordância em áudio tem de decidir a que distância dois limites podem estar para contarem como o mesmo evento.

  • ELAN tem um cálculo de fiabilidade entre anotadores integrado. Oferece um κ de Cohen modificado, segundo Holle e Rein, que liga anotações que se sobrepõem num mínimo definido, e o algoritmo Staccato, que tem em conta o acaso comparando uma segmentação com segmentações geradas aleatoriamente. Compara pares de camadas.
  • Potato reporta a IoU temporal para a sobreposição, α para a posição dos limites, α sobre os rótulos e α sobre se um evento foi marcado de todo. A tolerância de correspondência aparece como uma varredura de valores e não num único limiar. A sua documentação indica uma limitação: a sobreposição de segmentos ainda não tem uma linha de base de acaso. Veja Concordância ao longo do tempo.
  • Label Studio reserva a concordância para os planos pagos.

Uma tarefa de segmentação de áudio no Potato

yaml
annotation_schemes:
  - annotation_type: audio_annotation
    name: sound_events
    description: "Mark each sound and choose its type."
    mode: label
    labels:
      - {name: speech, color: "#4ECDC4"}
      - {name: music, color: "#FF6B6B"}
      - {name: noise, color: "#F39C12"}
    zoom_enabled: true

Os anotadores arrastam sobre a forma de onda para criar um segmento e escolhem o seu rótulo. Anotação de áudio cobre classificação, transcrição, classificações MOS e diarização no Potato.

O que o Potato não faz com áudio

  • Sem análise acústica. Altura, formantes e medidas espectrais são trabalho para o Praat.
  • Ferramentas de alinhamento mais simples do que as do ELAN. A interface de secretária do ELAN dá um controlo mais fino do alinhamento temporal.
  • Sem parser para ficheiros RTTM, Transcriber, EXMARaLDA ou CHAT isolados.

Verificado na documentação de cada projeto em setembro de 2026.

Perguntas frequentes

Qual é a melhor ferramenta gratuita de anotação de áudio?

O ELAN e o Praat são gratuitos e são a referência para trabalho linguístico e fonético de um único anotador. Para um estudo em que vários anotadores rotulam as mesmas gravações no navegador, o Potato e a Community Edition do Label Studio são gratuitos. O Potato inclui métricas de concordância, que o Label Studio reserva para os planos pagos.

O ELAN calcula a concordância entre anotadores?

Sim. O cálculo de fiabilidade do ELAN oferece um kappa de Cohen modificado e o algoritmo Staccato, e compara anotações em pares de camadas em vários ficheiros.

Posso anotar a diarização de falantes no navegador?

Sim. O Potato lê a saída diarizada do WhisperX, AWS Transcribe, Deepgram, AssemblyAI e Rev.ai, mostra os turnos sem falante como Unassigned com um seletor e, desde a versão 2.9, pode fazer a diarização localmente. O Label Studio também consegue rotular regiões de falante numa forma de onda.

Que ferramentas de anotação leem ficheiros TextGrid do Praat e EAF do ELAN?

O Praat e o ELAN trabalham nos seus próprios formatos. O Potato lê e exporta ambos, por isso um projeto pode passar de um estudo no navegador para qualquer uma das ferramentas de secretária.

Tenho de transcrever o áudio antes de o anotar?

Só se a anotação for sobre o que foi dito. Eventos sonoros, turnos de fala e classificações de qualidade rotulam-se diretamente na forma de onda. Para o conteúdo falado, parta de uma transcrição existente se a tiver, e transcreva de raiz quando a transcrição for o produto final ou o áudio for tão mau que a saída de ASR iria induzir os anotadores em erro.

Leituras adicionais