音频与转写文本是两份需分别处理的数据
别名: 录音与转写 · 双对象留存 · waveform versus text
概念解释
一次说话会留下至少两份对象:音频(波形,可再识别、可再训练、在不少法域里靠近生物识别)和转写文本(可检索、进日志、进客服工单、进分析仓)。产品里的「语音历史」常常只指向其中一份。删录音不等于删句子,留文本不等于还握着声音。这里要分别处理这两份对象,不是「告知留了哪些录音」,也不是「用户要能看见并删掉历史」——那些是范围披露和入口;这里是对象本身是两个。
机制
语音管道在唤醒后很快分叉。波形进对象存储,供质检、模型改进、争议回放;解码器输出的词格子落成文本,供 NLU、搜索、个性化、客服。此后两条生命期独立:压缩、冷存、索引、权限、是否出境,都可以分开配置。文本泄漏的方式是可搜索(「查一下昨天说的地址」);音频泄漏的方式是可再识别和可再处理(换一个识别器、做声纹、听出情绪)。法律性格也不一样:用于识别说话人的声音更靠近特殊类别,句子作为普通个人数据仍可被检索和引用。界面若只用「录音」一个词,用户删掉波形之后会以为句子也走了;分析仓和工单系统里的文本常常不在那个按钮的射程内。反过来,只删文本、留着波形,等于留下一份随时能再长出文本的种子。
怎么研究
做数据地图:一次真实会话之后,列出波形桶、转写表、搜索索引、客服副本各一份。请用户按产品文案执行「删除录音」,再在四处查找那句话。看的是哪几处还在,不是满不满意。把用户以为消失的对象和实际消失的对象做成列联——错位就是双对象没被当成双对象。
访谈问两句:「删掉之后还有没有你的声音」「还有没有你说过的字」。只问「隐私设置好不好用」会把两份对象并成一份态度。
边界
纯本地、识别后立即丢弃波形、文本也不落盘的听写,两份对象都不持久,这条管不到留存,只剩瞬时缓冲。法律要求保留的通话录音可能禁止删波形,仍应允许对转写做单独的访问控制。实时字幕若只存在于设备内存,关掉会话就没有第二份。把所有元数据(时间戳、设备、唤醒类型)算成「第三份」会把问题稀释;先把音频和文本当成必须分开的两份,元数据跟它们走。
怎么落地
- 历史和删除入口把「声音」和「说过的字」分成两个对象、两套动作,并写明删其中一个时另一个在不在。
- 「删除录音」的验收是波形桶和可再解码的缓存都空;「删除转写」的验收是历史、搜索、工单引用里那句话不再可查。两份都要测。
- 默认不要把文本当成波形的附属品一起无限期留着;文本的检索价值很高,更要单独设寿命。
- 验证:说一句带地址的话,删录音,再在伴侣应用、网页控制台、客服检索里找这个地址。找得到,文本就还是一份没被处理的数据。