C7.13.3No precise caret in voice editing设计研究
语音编辑缺少键盘编辑那样精确的光标定位手段
别名: 语音光标 · caret · 字级定位
概念解释
键盘和触控可以把插入点放到某一个字甚至字内。语音没有等价的精确光标:说“第三个字后面”不稳定,说“在‘会议’和‘纪要’之间”要先识别这两个锚,还可能撞上重复。语音编辑因此擅长整块替换,不擅长把 caret 停在指定缝隙。
机制
视觉-运动闭环让手指或鼠标对准像素级位置。语音的指称是符号级的,依赖文本里的独特字符串或序号。中文没有空格分词,“第 n 个字”对用户和对分词器常常不是同一计数。同音和重复词让锚点歧义。即便识别完美,口说一串坐标(行、列、偏移)的记忆负荷也高于看一眼再点。结果是:语音通道缺少一种廉价的“停在这里”原语。范围判定解决的是改哪一块;光标缺失解决的是没法把插入点放进块内的某一缝。两者叠在一起,才迫使替换以整词、整句为粒度。
怎么研究
比较三种定位:触控点选、口头序号、口头锚点短语,在要插入一个字、要删一个标点的任务上测时间和错误。材料用无空格中文和有重复词的句子。因变量包括最终 caret 是否落在意图缝隙。不要用英文空格文本外推中文计数。
边界
有屏幕时,语音负责大块、手指负责缝隙是合理分工,缺的是纯语音下的精确度,不是禁止混用。盲用屏幕阅读器有自己的导航粒度(字/词/行),那是另一套 caret,不能假装语音听写已经提供。等宽代码编辑对列位置更苛刻,语音更不适合。
怎么落地
- 把语音编辑的默认粒度定在词或句,不要诱导用户用“第几个字”做精细插入。
- 需要字级修改时,立刻露出触控或键盘,并把 caret 放在刚才识别出的词上,缩短切换。
- 若必须提供口头定位,用“选中这个词”加屏幕高亮,而不是看不见的序号。