J4.01.2automatic captions设计研究

自动字幕的错误率在专业内容上很高

别名: 自动字幕 · ASR 字幕 · 词错误率 · auto-captions

概念解释

平台一键打开的自动字幕(automatic captions / ASR captions)在闲聊、近场、单人清楚发音时像一份能用的草稿。一进医学课、法律听证、产品发布、学术报告,专有名词和关键否定会被换成隔壁的常用词,命题就反了。错误率高不是「偶有错字」,是专业内容上的默认状态。

机制

语音识别靠的是「常见话」的声学模型和语言模型。专业词在训练分布里是长尾:药品名、法条号、产品型号、人名、缩写的展开。模型会把它们折成发音相近的高频词——「不」和「有」一旦反了,整句的真值翻转。

第二层是声学场景。交叉谈话、远场、口罩、口音、术语被快速念出,声学置信度一起掉。领域热词表能拉回一部分已登记的产品名,登记之外的新词和同音术语仍然错。直播来不及改,错误被钉在那几秒的画面上,读者没有「回头看对的版本」。

把自动字幕当制作起点、再经人校对,和把引擎输出直接当交付,是两条完全不同的路径。后者在专业内容上会稳定地交出一份看起来像字幕、读起来像另一场演讲的文本。

怎么研究

以人工精标为参照,算词错误率(WER),专业内容再单列专有名词错误率——总体 WER 被大量功能词拉低时,专名照样全错。直播字幕常用 NER(Number of Errors in Recognition):把替换、插入、删除分开,并对关键专名加权。

自变量:领域(闲聊 / 医学 / 发布会)、是否加载领域词表、单人近场还是交叉谈话。 因变量:总体 WER、专名错误率、否定词翻转次数;以及看自动字幕的人能否答对领域问题。

抽三分钟比抽整场更可操作。理解题必须用领域事实,不能用「大意是否沾边」——沾边会把致命错放过去。

边界

点餐、有限指令、词表封闭的场景,自动识别可以够用。把自动字幕当校对前的草稿,错误率高仍然成立,只是不进入用户眼睛。通用闲聊、录音条件好,有时能过关。训练数据少的语言、口音、方言会更差,不能拿英语近场闲聊的演示去外推产品发布会。引擎不输出的那些维度(谁在说、那声响是什么)是另一张卡的问题;这里只判词对不对。

怎么落地

  • 专业课、发布会、医疗和法律内容,默认人工校对后再上线,不要把播放器自动轨当作已交付的字幕。
  • 维护领域词表:产品名、人名、反复出现的术语;发布前用本场讲稿对照抽查。
  • 直播配听打或短延迟校对;来不及校对就明确标成「自动生成,可能有误」,不要装成已审。
  • 验证:抽一段至少含十个专名或一个关键否定的三分钟,对照讲稿数错。一个会翻转命题的否定或药名错误,整段判不过。

延伸

  • 同组J4.01.1 字幕需包含说话人与关键音效 · J4.01.3 字幕样式需可调整
  • 相邻D2.12 声音与字幕的等效 · A3.08 听力损失对交互设计的启示
  • 站内检索automatic captions · ASR captions · word error rate

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/J4.01.2