VoiceAlign:一个用于增强传统语音用户界面系统可用性的自适应中间层

语音用户界面(VUI)设计大语言模型(LLM)的人机协作可解释人工智能(XAI)软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师

语音用户界面正从辅助功能转变为主流交互方式,但大多数操作系统内置语音命令尽管技术能力强大却未得到充分利用。通过对四个商业语音用户界面系统的分析和针对16名参与者的形成性研究,我们发现固定命令格式要求精确措辞、限制性超时机制在规划停顿期间丢弃输入、反馈不足阻碍多步骤交互。为解决这些挑战,我们开发了VoiceAlign,一个在用户和传统语音用户界面系统之间进行调解的自适应中间层。VoiceAlign拦截自然语音命令,使用大型语言模型将其转换以匹配所需语法,并通过虚拟音频通道传输这些适配后的命令,使其对底层系统保持透明。在对12名参与者的评估中,VoiceAlign将命令失败率减少一半,在与现有传统语音用户界面系统配对时每个任务需要的命令减少25%,并显著降低了认知和时间需求。此外,我们创建了由研究启发的大型语言模型,经过微调后在本地服务时实现了超过90%的准确率和200毫秒的响应时间,消除了对第三方API的依赖,同时实现了边缘设备上的实时交互。这项工作展示了现代AI技术如何释放传统语音用户界面系统的未充分利用潜力,无需系统修改,提供了一个无需更换现有基础设施的实用解决方案。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/226563/2026

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
语音用户界面(VUI)设计、大语言模型(LLM)的人机协作、可解释人工智能(XAI)
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文