基于词首提示条件大语言模型的多模态无声语音文本输入

电肌肉刺激(EMS)控制手部手势识别大语言模型(LLM)的人机协作

虽然在实现人与对话代理之间的无缝通信方面展现出巨大潜力,但大词汇量识别对于无声语音界面仍然具有挑战性。本研究提出了一种结合无声语音和打字的新型交互技术,在保护隐私的同时实现更高效的文本输入。该技术允许用户使用缩写短语输入,同时通过视觉信息确保高准确性。通过使用视觉语音编码器对大语言模型进行微调,我们使模型能够以单词首字母作为提示来解码语音内容。在现有数据集上的评估表明,与最先进的视觉语音识别模型相比,我们的模型可以将词错误率从20.3%降低到9.19%。用户研究结果表明输入速度和按键节省方面有显著提升。参与者报告称,我们的原型 LipType 整体上降低了感知工作负荷,尤其是在精力和体力需求维度。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/cui/204387/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3719160.3736612
一眼看懂

论文快照

fact_check
dataset
来源
CUI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
电肌肉刺激(EMS)控制、手部手势识别、大语言模型(LLM)的人机协作
work
职业/产业
article
内容状态
仅摘要
hub
相关论文
3 篇相关论文