VoiceAlign:一个用于增强传统语音用户界面系统可用性的自适应中间层
语音用户界面正从辅助功能转变为主流交互方式,但大多数操作系统内置语音命令尽管技术能力强大却未得到充分利用。通过对四个商业语音用户界面系统的分析和针对16名参与者的形成性研究,我们发现固定命令格式要求精确措辞、限制性超时机制在规划停顿期间丢弃输入、反馈不足阻碍多步骤交互。为解决这些挑战,我们开发了VoiceAlign,一个在用户和传统语音用户界面系统之间进行调解的自适应中间层。VoiceAlign拦截自然语音命令,使用大型语言模型将其转换以匹配所需语法,并通过虚拟音频通道传输这些适配后的命令,使其对底层系统保持透明。在对12名参与者的评估中,VoiceAlign将命令失败率减少一半,在与现有传统语音用户界面系统配对时每个任务需要的命令减少25%,并显著降低了认知和时间需求。此外,我们创建了由研究启发的大型语言模型,经过微调后在本地服务时实现了超过90%的准确率和200毫秒的响应时间,消除了对第三方API的依赖,同时实现了边缘设备上的实时交互。这项工作展示了现代AI技术如何释放传统语音用户界面系统的未充分利用潜力,无需系统修改,提供了一个无需更换现有基础设施的实用解决方案。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 83%
使用大型语言模型实现与移动UI的对话交互
CHI '23· 语音用户界面(VUI)设计 +1
- 83%
ONYX:通过多模式交互任务学习辅助用户教授自然语言接口
CHI '23· 语音用户界面(VUI)设计 +2
- 83%
Screen2Words:基于多模态学习的自动移动端UI摘要生成
UIST '21· 语音用户界面(VUI)设计 +1
- 71%
使用AI指南规划自然语言失败
CHI '21· 大语言模型(LLM)的人机协作 +2
- 71%
基于模型的强化学习适应用户界面
CHI '21· 大语言模型(LLM)的人机协作 +2
- 71%
ReactGenie:使用大型语言模型开发复杂多模式交互的框架
CHI '24· 语音用户界面(VUI)设计 +2
- 71%
AI 记忆差距:用户误记他们用 AI 或不用 AI 创建的内容
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
CoAutoML:面向机器学习新手的基于LLM的AutoML和测试驱动机器教学用户界面框架
IUI '26· 自动机器学习(AutoML)界面 +2
- 67%
使用实时编程验证AI生成的代码
CHI '24· 大语言模型(LLM)的人机协作 +1
- 67%
内容驱动的本地响应:支持带有和不带有AI的句子级和消息级移动电子邮件回复
CHI '25· 语音用户界面(VUI)设计 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)