M3.10.2speakable names for on-screen options设计研究

屏幕上的选项需要可被语音指称

别名: 屏幕选项的口头名 · 可说的卡片 · speakable GUI

概念解释

外卖界面并排四张只有商标的卡片。人看着屏说「那个绿色的」或「第二家」,语音层若没有把可见属性、序号和标题绑到实体上,看和说就接不上。屏幕选项需要可被语音指称(speakable names for on-screen options)要求:眼睛正在看的每一个可选项,都有一个能被说出口、也能被系统收下来的名字——可见标题、稳定序号、可区分的颜色或位置词。互补不是「屏上有图、嘴里报结论」,是用户能对正在显示的对象指示(deictic)点名。

机制

有屏时用户的指称策略会切到外指:他们说「这个」「左边那张」「绿色那家」,假定系统与他们共享当前画面。图形若只有图标、缩略图、无文字的色块,共享失败——人有视觉抓手,语音没有词汇抓手。识别器听的是词,不是像素;不把屏幕对象编成可说标签,两个通道在指称层断开。

可说名有三层,由稳到不稳:打印在卡片上的标题(用户照读)、当前屏内的序号(「第二个」)、视觉属性(「绿色的」)。标题要短、要和识别词表一致,不能是内部 SKU。属性只有在当前屏上唯一时才安全;四张都偏绿,「绿色的」失效。指示词「这个」还要绑定到焦点或注视,否则四个对象平权。

怎么研究

同一组候选用两种界面:图标加内部名短可见标题 + 序号。诱发看着屏用语音选。标注指称类型(标题、序号、颜色、位置、「这个」)和点名成功率。自变量:标题是否可见、是否与 ASR 词表一致、属性在当前屏是否唯一。眼动确认选择时人确实在看对应卡片。

失败模式要分开:看了但说不出合法名,是缺可说名;说了合法名系统没绑上,是链接层。不要用「多模态满意度」混在一起。实验室把标题做成巨大字幕会高估照读率;真机卡片标题往往是十号字。

边界

选项不在屏上(还在请求中、被折叠),可说名无对象,应先说清「屏上现在没有可选的」。纯听、屏未亮,指称应退回对话里的名称,不要假装有「这个」。用户离屏很远、标题不可读时,可见标题这层死了,序号和语音自己报的名字还在。把可说名理解成「把屏幕菜单再朗读一遍」,会变成重复而不是给眼睛已看到的对象补一个嘴能用的柄。

怎么落地

  • 每个可语音选择的屏幕对象都有:一句用户会照着说的短标题、一个当前屏内序号,并在识别里收下「第 N」「那个 + 标题」「左/右/上/下」。
  • 颜色、形状等属性只有在当前屏唯一时才当作合法抓手;不唯一就不要在视觉上暗示人可以这么说。
  • 标题用用户语言,不用内部名;标题改了,词表和屏幕一起改。
  • 验证:让人看真机卡片用语音选,禁止触控。统计「这个 / 绿色的 / 第二张」各有多少、成功多少。图标-only 上几乎全军覆没、加上短标题和序号后升上去,可说名才是补上的那一层。

延伸

  • 同组M3.10.1 视线不在屏幕上时视觉信息等于不存在 · M3.10.3 两个通道的时序需要对齐
  • 相邻M3.05 语音与屏幕互补 · M1.09 上下文保持与指代消解 · M2.06 功能可发现性与帮助
  • 站内检索speakable names for on-screen options · deictic · speakable GUI

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/M3.10.2