K5.04.3correctable TV speech results设计
识别结果需可修正
别名: 语音纠错 · 识别结果修正 · n-best TV search
概念解释
远场听错是常态。系统必须把「它以为你说了什么」放到大屏幕上,并让人改其中错的那一段,而不是整句重说、更不是把人推回屏幕键盘从第一个字母走。识别结果可修正是客厅语音搜索能被第二次使用的条件:第一次听错之后如果只能重来,人会改用封面浏览,语音通道被放弃。
机制
媒体查询里一个字错,检索就漂到另一部片子。错的常常是专有名词的一部分:人名的姓、片名里的数字、外语原名的一截。整句重说会把已经对的部分再赌一次,远场干扰下第二次不一定更好。局部修正把代价从「再发一次音」变成「在候选项里选一次」或「只改那个词」。
电视上改字本身很贵,所以修正界面不能是一个普通输入框。可用的修正是:N-best 列表(它还可能是哪几句)、词级高亮(点那个错词,给出近音替换)、以及「在当前结果里再筛」而不是清空重搜。确认键的默认动作必须是「用我看见的这句去搜」,不能在人还没看清转写时就跳进错误的结果页。
看不见的识别等于不可修正。只出结果不出转写,人无法判断是听错了还是库里没有,下一步只能盲目重说。
边界
一说就中的短唤醒(「暂停」「下一集」)不需要转写级修正,错了立刻再发一条指令更便宜。完全听成无关句子时,N-best 里也不会有对的,局部替换救不了,要提供「重说」和键盘回退两条出口。儿童或游戏化场景里,把错句大声读回可能造成尴尬或嘲笑,修正列表比朗读更合适。无障碍用户若以语音为唯一输入,修正必须也能靠语音完成(「第三个」「不要这个」),不能只给方向键列表。
怎么落地
- 每次查询在屏幕上显示转写,并在人确认前停住;默认焦点在「搜索这句」,旁边是可聚焦的候选句。
- 错词可被单独选中并换成近音或键盘只改该词,不要为改一个字打开全量屏幕键盘。
- 连续两次仍不对,把出口换成「用封面浏览」或「在手机上输入」,而不是第三次「请再说一遍」。
- 验证:故意用易混片名和含数字、外语词的查询,看第一次识别失败后,人能否在两步内改对且不再开口。改不对或放弃的案例,记录是看不见转写、候选项里没有对的,还是修正本身要走键盘。