Herramientas de anotación de audio comparadas: ELAN, Praat, Label Studio y Potato
Compara ELAN, Praat, Label Studio, Prodigy, VIA y Potato para transcripción, diarización de hablantes, eventos sonoros y anotación por niveles, con formatos de archivo y acuerdo.
La anotación de audio pone etiquetas a tramos de una grabación: quién habla, qué dijo, qué sonido se produjo o qué calidad tiene la grabación. ELAN y Praat son las herramientas de escritorio habituales para un lingüista que trabaja una grabación nivel por nivel. Potato, Label Studio y Prodigy funcionan en el navegador, lo que conviene a estudios en los que muchos anotadores etiquetan las mismas grabaciones. Se diferencian en si leen transcripciones existentes y en cómo miden el acuerdo.
La diarización de hablantes divide una grabación según quién habla. El reconocimiento de voz produce una transcripción que luego corrigen los anotadores. La detección de eventos sonoros marca dónde aparece un sonido como una sirena o una puerta. Un nivel (tier), en ELAN y Praat, es una capa de anotaciones sobre la línea de tiempo de la grabación, de modo que palabras, fonemas y gestos se etiquetan por separado. El mean opinion score puntúa la calidad percibida de un clip.
Esta página trata el audio y la voz. Herramientas de anotación con IA, comparadas cubre todos los tipos de datos en una sola página.
¿Qué herramientas de anotación de audio vale la pena comparar?
| Herramienta | Funciona como | Licencia | Adecuada para |
|---|---|---|---|
| Potato | Aplicación web | GPL-3.0 | Estudios con varios anotadores: segmentos, niveles, corrección de transcripciones, valoraciones de calidad |
| ELAN | Aplicación de escritorio para Windows, macOS y Linux | GPL-3.0 | Niveles alineados en el tiempo, con hasta cuatro vídeos vinculados y vocabularios controlados |
| Praat | Aplicación de escritorio | Código abierto | Análisis fonético y anotación en TextGrid |
| Label Studio | Aplicación web | Apache-2.0 (Community Edition), con planes de pago | Regiones etiquetadas sobre una forma de onda, audio multicanal, espectrogramas, transcripción |
| Prodigy | Aplicación web en local | Propietaria | Etiquetado de regiones (audio.manual) y transcripción (audio.transcribe) |
| VIA 3 | Un único archivo HTML, sin conexión en el navegador | BSD-2-Clause | Etiquetado rápido de segmentos sin instalar nada |
¿Qué herramienta para cada tarea de audio?
| Tarea | Buenas opciones |
|---|---|
| Tono, formantes y otras medidas acústicas | Praat |
| Anotación lingüística por niveles a cargo de un especialista | ELAN, Praat |
| Corregir transcripciones de ASR con varios anotadores | Potato, Label Studio |
| Revisar la diarización de hablantes | Potato, Label Studio |
| Detección de eventos sonoros | Potato, Label Studio, Prodigy |
| Valoraciones de calidad (MOS) | Potato, Label Studio |
| Codificación de conducta o gestos junto al audio | ELAN, BORIS |
Partir de una transcripción existente
La mayoría de los proyectos de voz empiezan con una transcripción de Whisper, de una API en la nube o de un archivo de subtítulos. Potato lee 21 formatos de transcripción y subtítulos y muestra los turnos como burbujas de hablante sincronizadas con el audio, así que los anotadores corrigen segmentos en lugar de teclearlos desde cero. Entre los formatos están el JSON de Whisper y WhisperX, AWS Transcribe, Deepgram, AssemblyAI, Rev.ai, SubRip, WebVTT, NIST CTM, TextGrid de Praat y EAF de ELAN. Potato no lee archivos RTTM de diarización por sí solos, ni Transcriber, EXMARaLDA o CHAT, que hay que convertir antes. Consulta Formatos de transcripción.
Desde la versión 2.9, Potato también puede transcribir y diarizar en tu propia máquina, con faster-whisper y sherpa-onnx, sin PyTorch y sin token de Hugging Face. Consulta Transcribir en local.
En Label Studio y Prodigy, una transcripción de otro sistema se convierte primero al formato de tareas propio de la herramienta. La etiqueta Audio de Label Studio se combina con una TextArea para transcribir, y la receta audio.transcribe de Prodigy une la reproducción con un cuadro de texto.
Llevar la anotación por niveles entre ELAN, Praat y Potato
El esquema tiered_annotation de Potato admite niveles independientes y dependientes, de modo que un nivel de palabras puede subdividir en el tiempo un nivel de enunciados, como en ELAN. Potato exporta EAF y TextGrid. Un estudio puede recoger anotaciones de muchas personas en el navegador y entregar el resultado a alguien que trabaje en ELAN o Praat.
ELAN sigue siendo la mejor herramienta para que un experto trabaje una grabación en detalle, con vistas sincronizadas de hasta cuatro vídeos. Praat sirve para el análisis acústico, que Potato no intenta hacer.
Acuerdo en el tiempo
Dos anotadores que marcan el mismo sonido rara vez coinciden al milisegundo, así que el acuerdo en audio tiene que decidir a qué distancia deben estar dos límites para contar como el mismo evento.
- ELAN tiene un cálculo de fiabilidad entre anotadores integrado. Ofrece una κ de Cohen modificada, según Holle y Rein, que vincula anotaciones que se solapan un mínimo fijado, y el algoritmo Staccato, que tiene en cuenta el azar comparando una segmentación con otras generadas aleatoriamente. Compara pares de niveles.
- Potato informa la IoU temporal para el solapamiento, α para la posición de los límites, α sobre las etiquetas y α sobre si se marcó un evento en absoluto. La tolerancia de emparejamiento se muestra como un barrido de valores y no en un único umbral. Su documentación indica una limitación: el solapamiento de segmentos todavía no tiene una línea base de azar. Consulta Acuerdo en el tiempo.
- Label Studio reserva el acuerdo para sus planes de pago.
Una tarea de segmentación de audio en Potato
annotation_schemes:
- annotation_type: audio_annotation
name: sound_events
description: "Mark each sound and choose its type."
mode: label
labels:
- {name: speech, color: "#4ECDC4"}
- {name: music, color: "#FF6B6B"}
- {name: noise, color: "#F39C12"}
zoom_enabled: trueLos anotadores arrastran sobre la forma de onda para crear un segmento y eligen su etiqueta. Anotación de audio cubre la clasificación, la transcripción, las valoraciones MOS y la diarización en Potato.
Lo que Potato no hace con audio
- No hace análisis acústico. El tono, los formantes y las medidas espectrales corresponden a Praat.
- Herramientas de alineación más sencillas que las de ELAN. La interfaz de escritorio de ELAN da un control más fino de la alineación temporal.
- No lee archivos RTTM, Transcriber, EXMARaLDA ni CHAT por sí solos.
Comprobado en la documentación de cada proyecto en septiembre de 2026.
Preguntas frecuentes
¿Cuál es la mejor herramienta gratuita de anotación de audio?
ELAN y Praat son gratuitas y son el estándar para el trabajo lingüístico y fonético de un solo anotador. Para un estudio en el que varios anotadores etiquetan las mismas grabaciones en el navegador, Potato y la Community Edition de Label Studio son gratuitas. Potato incluye métricas de acuerdo, que Label Studio reserva para sus planes de pago.
¿ELAN calcula el acuerdo entre anotadores?
Sí. El cálculo de fiabilidad de ELAN ofrece una kappa de Cohen modificada y el algoritmo Staccato, y compara anotaciones en pares de niveles de varios archivos.
¿Puedo anotar la diarización de hablantes en el navegador?
Sí. Potato lee la salida diarizada de WhisperX, AWS Transcribe, Deepgram, AssemblyAI y Rev.ai, muestra los turnos sin hablante como Unassigned con un selector y, desde la versión 2.9, puede diarizar en local. Label Studio también puede etiquetar regiones de hablante sobre una forma de onda.
¿Qué herramientas de anotación leen archivos TextGrid de Praat y EAF de ELAN?
Praat y ELAN trabajan con sus propios formatos. Potato lee y exporta ambos, así que un proyecto puede pasar de un estudio en el navegador a cualquiera de las dos herramientas de escritorio.
¿Tengo que transcribir el audio antes de anotarlo?
Solo si la anotación trata de lo que se dijo. Los eventos sonoros, los turnos de habla y las valoraciones de calidad se etiquetan directamente sobre la forma de onda. Para el contenido hablado, parte de una transcripción existente si la tienes, y transcribe desde cero cuando la transcripción sea el producto final o el audio sea tan malo que la salida de ASR confundiría a los anotadores.
Lecturas adicionales
- Herramientas de anotación con IA, comparadas, todos los tipos de datos en una página
- Herramientas de anotación de texto comparadas
- Herramientas de anotación de imágenes comparadas
- Herramientas de anotación de vídeo comparadas
- Herramientas de evaluación de agentes de IA comparadas
- Herramientas de evaluación de modelos del mundo y episodios de robots comparadas
- Anotar transcripciones de Whisper