D2.12.2Non-speech audio description设计研究

非语言声音需要额外的文字描述而非仅转写台词

别名: audio description · sound effects captioning · non-speech cues

概念解释

非语言声音需要被单独描述。门响、警报、脚步、音乐主题,这些声音不构成台词,因此不会出现在只转写对白的字幕里,但它们往往承担了情节转折、位置提示或情绪铺垫的功能。缺少这些描述,读者得到的是一个只有人物说话的世界。

机制

非语言声音在叙事与界面中承担两类作用:事件信号与情境塑造。前者如提示音、警报、提示性音效,直接影响用户下一步动作;后者如环境音与配乐,影响情绪理解。转写对白时二者都被跳过,因为它们没有语言形式。要补上,必须由人(或可靠模型)把声音的语义识别出来并转成文字,这一步无法从对白内容自动推导,因此需要专门的描述策略与工作量预算。

怎么研究

可让只读描述文本的用户复述发生了什么、谁在场、是否有危险信号,与只听音频或看完整音视频的用户对照,测量事件识别率与情境理解偏差。变量包括描述详细程度、是否区分事件性与氛围性声音、以及描述是否与对白时间轴冲突。因变量应区分「漏掉事件」与「误判氛围」,因为两者对理解的破坏方式不同。

边界

并非所有声音都需要描述。持续的背景噪声或装饰性音效若不影响理解,逐一转写只会淹没对白。描述也受时间轴限制:与对白同时发生的声音需要在有限空档中呈现,因此必须做优先级取舍。若某个声音在视觉上已有等价呈现(例如可见的关门动作),额外文字描述可能冗余。

怎么落地

  • 先列出会影响理解与行动的非语言声音,按事件性与氛围性分开处理。
  • 用简洁的现在时短语描述声音及其来源,例如「远处传来警笛」而不是罗列声学参数。
  • 当描述与对白争夺同一时间槽时,优先保留事件性声音。
  • 验证方式:只用描述文本让用户复述事件与场景,检查是否遗漏了影响后续情节或操作的声音。

延伸

  • 同组D2.12.1 字幕承载声音中的语言内容但难以还原语气与紧迫感 · D2.12.4 等效不等于完全替代,部分声音信息在转写中会丢失
  • 相邻J2.03 字幕与文字替代的覆盖范围 · D2.01.1 抽象提示音需要学习才能建立映射
  • 站内检索audio description · non-speech cues · captions

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/D2.12.2