D2.12.2Non-speech audio description设计研究
非语言声音需要额外的文字描述而非仅转写台词
别名: audio description · sound effects captioning · non-speech cues
概念解释
非语言声音需要被单独描述。门响、警报、脚步、音乐主题,这些声音不构成台词,因此不会出现在只转写对白的字幕里,但它们往往承担了情节转折、位置提示或情绪铺垫的功能。缺少这些描述,读者得到的是一个只有人物说话的世界。
机制
非语言声音在叙事与界面中承担两类作用:事件信号与情境塑造。前者如提示音、警报、提示性音效,直接影响用户下一步动作;后者如环境音与配乐,影响情绪理解。转写对白时二者都被跳过,因为它们没有语言形式。要补上,必须由人(或可靠模型)把声音的语义识别出来并转成文字,这一步无法从对白内容自动推导,因此需要专门的描述策略与工作量预算。
怎么研究
可让只读描述文本的用户复述发生了什么、谁在场、是否有危险信号,与只听音频或看完整音视频的用户对照,测量事件识别率与情境理解偏差。变量包括描述详细程度、是否区分事件性与氛围性声音、以及描述是否与对白时间轴冲突。因变量应区分「漏掉事件」与「误判氛围」,因为两者对理解的破坏方式不同。
边界
并非所有声音都需要描述。持续的背景噪声或装饰性音效若不影响理解,逐一转写只会淹没对白。描述也受时间轴限制:与对白同时发生的声音需要在有限空档中呈现,因此必须做优先级取舍。若某个声音在视觉上已有等价呈现(例如可见的关门动作),额外文字描述可能冗余。
怎么落地
- 先列出会影响理解与行动的非语言声音,按事件性与氛围性分开处理。
- 用简洁的现在时短语描述声音及其来源,例如「远处传来警笛」而不是罗列声学参数。
- 当描述与对白争夺同一时间槽时,优先保留事件性声音。
- 验证方式:只用描述文本让用户复述事件与场景,检查是否遗漏了影响后续情节或操作的声音。