K5.04.1TV far-field voice search设计
语音是电视上最有效的文本输入
别名: 电视语音搜索 · 远场语音输入 · spoken TV search
概念解释
在客厅要输入片名、演员、歌曲名时,对着电视说话通常比在屏幕键盘上走格子快一个数量级。语音是电视上最有效的文本输入,指的是这条通道相对方向键选字的效率,不是对话系统的一般理论,也不是手机上的语音助手通论。人坐在几米外,手里只有遥控器,查询是短的专有名词——这是远场搜索,不是多轮办事。
机制
片名是稀疏、长尾、常含生僻字的字符串。屏幕键盘上每个字符都是一次网格行走,一个片名的按键数轻易上百,中间任何一次走错都要退格再走。语音把整串变成一次发音,代价从「逐字瞄准」变成「说对一次」。电视的麦克风或遥控器麦克风就在这个距离上工作,人不必起身去够一块物理键盘。
有效是相对的。查询短、目标是检索而不是填表、词汇以媒体库为主,语音的优势最大。一旦任务变成输入邮箱、验证码、复杂密码,专有名词语言模型帮不上忙,语音的有效性会掉到和其他通道同一量级,甚至更差。把搜索框当成「电视上的文本入口」而不提供语音,等于强迫最高频的查询走最贵的通道。
唤醒必须够便宜。语音键、免提唤醒、或焦点落到搜索框即开麦,决定人会不会在已经拿着遥控器的情况下还愿意开口。开口成本高于再按二十次方向键时,理论优势不会变成实际选择。
边界
公共场合、深夜怕吵、家里有人睡觉,开口的社交成本会压过效率,屏幕键盘仍要作为完整通路留下。方言、儿童、口齿不清、以及片名本身就是外语时,识别率下降,有效性不再自动成立。无麦克风的老遥控、机顶盒外置盒没有远场阵列,这条通道物理上不存在。纯浏览、比较封面的任务不产生查询字符串,语音没有输入可替代。
怎么落地
- 把语音做成搜索的主路径:搜索页一出现就可以说,不要先走完屏幕键盘再在角落提供一个麦克风图标。
- 屏幕键盘保留为回退,而不是并列的「同等推荐」;主按钮的标签是「说话」或遥控器上的语音键提示。
- 查询的语言模型按媒体库偏置:片名、人名、歌曲优先于通用网络搜索的问句模板。
- 验证:同一批片名分别用语音和方向键键盘完成,记录时间和放弃。若语音没有稳定快出好几倍,检查的是唤醒步骤和是否被键盘流程挡住,而不是再训练一个通用对话模型。