مقارنة أدوات التعليق على الصوت: ELAN وPraat وLabel Studio وPotato
مقارنة بين ELAN وPraat وLabel Studio وProdigy وVIA وPotato في التفريغ النصي وفصل المتحدثين والأحداث الصوتية والتوصيف متعدد الطبقات، مع صيغ الملفات والاتفاق.
يضع التعليق على الصوت تسميات على مقاطع من تسجيل: من يتكلم، وماذا قال، وأي صوت وقع، أو ما جودة التسجيل. ELAN وPraat هما أداتا سطح المكتب المعياريتان للّغوي الذي يعمل على تسجيل طبقةً بعد طبقة. أما Potato وLabel Studio وProdigy فتعمل في المتصفح، وهذا يناسب الدراسات التي يوسم فيها موصِّفون كثيرون التسجيلات نفسها. وتختلف في قراءة التفريغات النصية الموجودة وفي طريقة قياس الاتفاق.
يقسّم فصل المتحدثين التسجيل بحسب من يتكلم. وينتج التعرّف على الكلام تفريغًا نصيًا يصحّحه الموصِّفون بعد ذلك. ويحدّد كشف الأحداث الصوتية موضع صوت مثل صفارة إنذار أو باب. والطبقة (tier) في ELAN وPraat مستوى من التوصيفات فوق الخط الزمني للتسجيل، فتُوسَم الكلمات والوحدات الصوتية والإيماءات كلٌّ على حدة. ويقيّم متوسط درجة الرأي الجودة المُدرَكة لمقطع.
تتناول هذه الصفحة الصوت والكلام. أما المقارنة التي تجمع كل أنواع البيانات في صفحة واحدة ففي مقارنة أدوات التعليق بالذكاء الاصطناعي.
أي أدوات التعليق على الصوت تستحق المقارنة؟
| الأداة | تعمل بوصفها | الترخيص | مناسبة لـ |
|---|---|---|---|
| Potato | تطبيق ويب | GPL-3.0 | الدراسات متعددة الموصِّفين: مقاطع وطبقات وتصحيح تفريغات وتقييمات جودة |
| ELAN | تطبيق سطح مكتب لـ Windows وmacOS وLinux | GPL-3.0 | طبقات مُحاذاة زمنيًا، مع ما يصل إلى أربعة ملفات فيديو مرتبطة ومفردات مضبوطة |
| Praat | تطبيق سطح مكتب | مفتوح المصدر | التحليل الصوتي والتوصيف بصيغة TextGrid |
| Label Studio | تطبيق ويب | Apache-2.0 (النسخة المجتمعية)، مع خطط مدفوعة | مناطق موسومة على شكل موجي، وصوت متعدد القنوات، ومخططات طيفية، وتفريغ نصي |
| Prodigy | تطبيق ويب يعمل محليًا | مملوك | وسم المناطق (audio.manual) والتفريغ النصي (audio.transcribe) |
| VIA 3 | ملف HTML واحد يعمل دون اتصال في المتصفح | BSD-2-Clause | وسم سريع للمقاطع دون تثبيت أي شيء |
أي أداة لأي مهمة صوتية؟
| المهمة | الخيارات المناسبة |
|---|---|
| درجة الصوت والبواني وغيرها من القياسات الصوتية | Praat |
| التوصيف اللغوي متعدد الطبقات على يد مختص | ELAN، Praat |
| تصحيح تفريغات التعرّف الآلي على الكلام بعدة موصِّفين | Potato، Label Studio |
| مراجعة فصل المتحدثين | Potato، Label Studio |
| كشف الأحداث الصوتية | Potato، Label Studio، Prodigy |
| تقييمات الجودة (MOS) | Potato، Label Studio |
| ترميز السلوك أو الإيماءات إلى جانب الصوت | ELAN، BORIS |
البدء من تفريغ نصي موجود
تبدأ معظم مشاريع الكلام بتفريغ نصي من Whisper أو من واجهة برمجية سحابية أو من ملف ترجمة مرئية. يقرأ Potato 21 صيغة للتفريغ والترجمة المرئية، ويعرض الأدوار فقاعاتٍ للمتحدثين متزامنة مع الصوت، فيصحّح الموصِّفون المقاطع بدل كتابتها من الصفر. ومن الصيغ: JSON من Whisper وWhisperX، وAWS Transcribe، وDeepgram، وAssemblyAI، وRev.ai، وSubRip، وWebVTT، وNIST CTM، وTextGrid من Praat، وEAF من ELAN. ولا يقرأ Potato ملفات RTTM لفصل المتحدثين وحدها، ولا Transcriber أو EXMARaLDA أو CHAT، ويجب تحويلها أولًا. راجع صيغ التفريغ النصي.
ومنذ الإصدار 2.9، يستطيع Potato أيضًا إجراء التفريغ النصي وفصل المتحدثين على جهازك، باستخدام faster-whisper وsherpa-onnx، دون PyTorch ودون رمز Hugging Face. راجع التفريغ النصي محليًا.
في Label Studio وProdigy يُحوَّل التفريغ الآتي من نظام آخر أولًا إلى صيغة المهام الخاصة بالأداة. يُقرن وسم Audio في Label Studio بعنصر TextArea للتفريغ النصي، وتجمع وصفة audio.transcribe في Prodigy بين التشغيل ومربع نص.
نقل التوصيف متعدد الطبقات بين ELAN وPraat وPotato
يضم مخطط tiered_annotation في Potato طبقات مستقلة وأخرى تابعة، فيمكن لطبقة الكلمات أن تقسّم طبقة الأقوال زمنيًا كما في ELAN. ويصدّر Potato بصيغتي EAF وTextGrid. ويمكن لدراسة أن تجمع التوصيفات من أشخاص كثيرين في المتصفح، ثم تسلّم النتيجة إلى من يعمل في ELAN أو Praat.
يبقى ELAN الأداة الأفضل لخبير يعمل على تسجيل بالتفصيل، مع عروض متزامنة لما يصل إلى أربعة فيديوهات. أما Praat فللتحليل الصوتي، وهو ما لا يحاوله Potato.
الاتفاق عبر الزمن
نادرًا ما يتفق موصِّفان يحدّدان الصوت نفسه حتى الجزء من الألف من الثانية، ولذلك على الاتفاق في الصوت أن يحدّد كم يجب أن تتقارب حدّان ليُحسبا الحدث نفسه.
- ELAN فيه حساب مدمج لموثوقية الاتفاق بين الموصِّفين. يوفّر κ كوهين المعدَّل وفق Holle وRein، الذي يربط التوصيفات المتداخلة بحدٍّ أدنى محدّد، وخوارزمية Staccato التي تراعي الصدفة بمقارنة تقسيمٍ ما بتقسيمات مولَّدة عشوائيًا. ويقارن أزواجًا من الطبقات.
- Potato يُبلغ عن IoU الزمني للتداخل، وعن α لمواضع الحدود، وα على التسميات، وα على ما إذا كان حدثٌ قد حُدِّد أصلًا. ويُعرض سماح المطابقة مسحًا عبر قيم متعددة بدل عتبة واحدة. ويذكر توثيقه قيدًا واحدًا: ليس لتداخل المقاطع بعدُ خط أساس للصدفة. راجع الاتفاق عبر الزمن.
- Label Studio يحصر الاتفاق في خططه المدفوعة.
مهمة تقسيم صوتي في Potato
annotation_schemes:
- annotation_type: audio_annotation
name: sound_events
description: "Mark each sound and choose its type."
mode: label
labels:
- {name: speech, color: "#4ECDC4"}
- {name: music, color: "#FF6B6B"}
- {name: noise, color: "#F39C12"}
zoom_enabled: trueيسحب الموصِّفون على الشكل الموجي لإنشاء مقطع ثم يختارون تسميته. ويتناول التعليق على الصوت التصنيف والتفريغ النصي وتقييمات MOS وفصل المتحدثين في Potato.
ما لا يفعله Potato مع الصوت
- لا تحليل صوتي. درجة الصوت والبواني والقياسات الطيفية من اختصاص Praat.
- أدوات محاذاة أبسط من أدوات ELAN. تمنح واجهة ELAN المكتبية تحكمًا أدق في المحاذاة الزمنية.
- لا محلّل لملفات RTTM أو Transcriber أو EXMARaLDA أو CHAT وحدها.
جرى التحقق من توثيق كل مشروع في سبتمبر 2026.
الأسئلة الشائعة
ما أفضل أداة مجانية للتعليق على الصوت؟
ELAN وPraat مجانيتان، وهما المعيار في العمل اللغوي والصوتي لموصِّف واحد. أما لدراسة يوسم فيها عدة موصِّفين التسجيلات نفسها في المتصفح، فإن Potato والنسخة المجتمعية من Label Studio مجانيتان. ويتضمن Potato مقاييس الاتفاق، التي يحصرها Label Studio في خططه المدفوعة.
هل يحسب ELAN الاتفاق بين الموصِّفين؟
نعم. يوفّر حساب الموثوقية في ELAN كابا كوهين المعدَّلة وخوارزمية Staccato، ويقارن التوصيفات على أزواج من الطبقات عبر عدة ملفات.
هل يمكنني توصيف فصل المتحدثين في المتصفح؟
نعم. يقرأ Potato المخرجات المفصولة حسب المتحدث من WhisperX وAWS Transcribe وDeepgram وAssemblyAI وRev.ai، ويعرض الأدوار التي لا متحدث لها بوصفها Unassigned مع أداة اختيار، ويستطيع منذ الإصدار 2.9 فصل المتحدثين محليًا. ويستطيع Label Studio أيضًا وسم مناطق المتحدثين على شكل موجي.
أي أدوات التعليق تقرأ ملفات TextGrid من Praat وEAF من ELAN؟
يعمل Praat وELAN بصيغتيهما. ويقرأ Potato الصيغتين ويصدّرهما، فيمكن لمشروع أن ينتقل بين دراسة في المتصفح وأيٍّ من أداتي سطح المكتب.
هل يجب أن أفرّغ الصوت نصيًا قبل توصيفه؟
فقط إذا كان التوصيف يتعلق بما قيل. تُوسَم الأحداث الصوتية وأدوار المتحدثين وتقييمات الجودة مباشرة على الشكل الموجي. أما المحتوى المنطوق، فابدأ من تفريغ موجود إن توفّر، وفرّغ من الصفر حين يكون التفريغ هو الناتج المطلوب أو حين يكون الصوت رديئًا إلى حدّ أن مخرجات التعرّف الآلي ستضلّل الموصِّفين.