音频标注
Potato 音频标注完整指南:整段分类、多标签打标、在波形上做声音事件检测、转写、质量(MOS)评分、情绪识别与说话人分离。
音频标注的范围很广,从给整段音频打一个标签("这是语音还是音乐?"),到在波形上标出某个声音出现的确切时刻。 Potato 会显示一条可交互的波形,带播放控制和时间标记,因此分类、打标、时间对齐的事件检测、转写、质量评分和说话人相关的任务都能在同一个工具里完成。功能参考见音频标注。
本指南把常见的音频任务逐一对应到 Potato 的配置方式和一个可直接运行的示例设计。
整段分类
给整段音频打一个类别标签。这类任务包括声学场景分类、环境声音分类、关键词检出和呼吸音分类。
annotation_schemes:
- annotation_type: radio
name: scene
description: "What environment was this recorded in?"
labels: [Street, Park, Office, Home, Vehicle]多标签打标
当多个声音或标签同时成立时——比如音乐打标和 AudioSet 式事件分类——使用 multiselect。
annotation_schemes:
- annotation_type: multiselect
name: tags
description: "Select every instrument you can hear."
labels: [Guitar, Drums, Piano, Vocals, Bass, Synth]声音事件检测:波形上的区间
要标出一个声音何时开始、何时结束,就在音频时间轴上标注区间。这就是声音事件检测,相当于音频版的区间标注。
annotation_schemes:
- annotation_type: span
name: events
description: "Mark the start and end of each sound event and label it."
labels: [Speech, Music, Dog bark, Siren, Silence]从零开始转写
做音频转写时,把播放功能和一个自由文本字段搭配起来。标注者可以一边拖动波形一边输入。
annotation_schemes:
- annotation_type: text
name: transcript
description: "Type what is said in this clip."在已有转写稿上标注
从零开始转写是成本最高的情形。多数项目手上已经有一份转写稿——来自 Whisper、某个云端 ASR 接口,或是随视频一起下载的字幕。Potato 能读取 21 种转写与字幕格式,并把其中的话轮渲染成与音频同步的说话人气泡,标注者只需给这些片段打标,而不必重新切分。
instance_display:
fields:
- key: conversation
type: audio_dialogue
label: "Transcript"
span_target: true
display_options:
show_timestamps: true
allow_speaker_assignment: auto选哪一种取决于你要测量什么。当转写稿本身就是交付物时,或者音频质量差到 ASR 输出会把标注者带偏时,就从零开始转写。当你关心的是内容本身,或者你正在检查 ASR 质量、希望错误清晰可见时,就从已有转写稿出发。
参见标注 Whisper 转写稿和标注 YouTube 字幕。
质量评分:MOS 与可懂度
主观音质用平均意见得分衡量,即在多位听者之间取平均的 1–5 分李克特评分。这类任务包括语音质量(MOS)和语音可懂度。
annotation_schemes:
- annotation_type: likert
name: mos
description: "Rate the overall quality of this audio."
size: 5
min_label: "Bad"
max_label: "Excellent"量表设计方面的建议见评分量表。
情绪与情感
语音情绪识别和音频情感分析会把一个类别(情绪)和若干维度评分(唤醒度、效价)结合起来,用 radio 搭配 slider 或 likert 实现。
说话人分离
说话人分离回答的是"谁在什么时候说话"。标注者标出时间区间,并把每段关联到某位说话人,也就是区间标注加上一个关联步骤。
如果上游已经跑过分离——用 WhisperX 或某个云端接口——Potato 会直接读取说话人标签,标注者只需修正其中的错误。未分配的话轮会显示为 Unassigned 并附带一个选择器;在音质糟糕的素材上,人耳判断往往胜过自动系统。
实践建议
- 音频片段要短到听一两遍就能判断;片段过长会拉低一致性。
- 做事件检测时,先就边界需要多精确达成共识,并在区间层面测量一致性,参见标注者间一致性。
- 对所有片段做响度归一化,避免质量评分被音量大小左右。