字幕需包含说话人与关键音效
别名: 说话人标识 · 音效字幕 · closed captions · non-speech captions
概念解释
关掉声音之后,这一行字还要能回答两件事:谁在说,以及刚才那声不是对白的响动意味着什么。字幕(captions / closed captions)若只转写台词,多人对话会变成无主句,门铃、枪响、警报、画外的一声笑也会从情节里消失。它服务的是听不见、听不清、或此刻不能开声音的人,靠的是叠在画面时间轴上的那一层字,不是另一份可以整页检索的稿。
机制
视频里的听觉信息至少分三层:词、说话人身份、事件性声音。词可以落成字形;身份在口型清楚、人一直出镜时,画面还能补一截。人一出画、电话另一头开口、切镜后两人抢话,视觉线索就断了,字必须自己带上说话人标签,否则读者只能猜。
关键音效没有词可转。它推进的是事件:门开了、倒计时响了、观众在笑。漏标等于漏事件。持续的环境噪声通常不进字幕,不是因为它「不是声音」,而是因为它不改变下一步判断;主题乐突然出现若在揭示身份,那就不是装饰。
怎么研究
关声只看字幕,做说话人归属和事件检出两套题,不要混成一个满意度分。题目要问「这句是谁说的」「门有没有响」,不要问「好不好看」。
自变量:有无说话人标签、有无音效标注、说话人是否在画内。 因变量:归属正确率、关键事件漏检率、把旁白误判成角色对白的次数。
广播字幕质检(如说话人标识、非言语标注是否齐全)可以当制作侧清单;它替代不了关声理解测验——清单能勾「有标签」,测验才知道标签有没有标对人。
边界
单人出镜、口型清楚、全程可见时,每句都冠名会吵。画面里已经用名牌标了发言者的会议产品,字幕再重复一遍可能冗余。装饰性底噪、与情节无关的街道声不必逐条。实时字幕抢时间,音效标注会变稀,那是时效与完整的权衡,不是「音效可以不标」。语气、空间方向很难靠几个字还原——字幕的完整指的是谁在说、发生了哪类关键声,不是声学全貌。
怎么落地
- 两人或以上开口时,用名字或角色标说话人;画外音、电话对端、旁白单独标。
- 先列出改变理解或下一步动作的声音(警报、门、笑声、关键提示音),写成「[门铃响]」这类短标签,不要把频谱写进字幕。
- 同一时间槽里对白和音效打架,优先保住会改变判断的那一声,再压缩对白行数。
- 验证:静音从头看一遍,每句问「这是谁说的」,每个转折问「刚才发生了什么声」。指错的人、漏掉的声,就是字幕还只是台词清单。