Tap&Say:结合触摸位置的大型语言模型,用于智能手机上的多模态文本校正
作者
大语言模型(LLM)的人机协作软件工程师与开发者UI/UX 设计师
研究背景与问题
-
发现的问题或挑战:
- 在智能手机上进行文本编辑通常需要准确的光标定位和键盘输入,这个过程费时且繁琐。
- 尽管语音输入提供了一种替代的文本编辑方式,但实际应用中面临两个主要挑战:
- 可靠地区分语音命令(编辑指令)与语音内容输入。
- 精确定位用户期望编辑的文本区域。
-
问题重要性:
- 智能手机的文本编辑是日常通信、记录和生产任务的重要组成部分。解决这些挑战能够显著提升移动设备上的编辑效率。
- 多模态交互(如触摸和语音结合)使移动设备上的操作更加直观和高效,但需要技术突破来优化体验。
-
研究动机与相关工作:
- 现有基于语音的文本编辑解决方案在区分语音内容与命令以及定位编辑区域方面存在局限性。方法如使用启发式规则或通过简单语言模型来实现,但这些方法在处理复杂或模糊输入时表现不足。
- 作者提出 Tap&Say,以克服现有方法的不足,特别是通过融合触控定位与大型语言模型(LLM)实现更高的语义理解。
解决方案
-
提出的解决方法:
- 作者设计并实现了 Tap&Say,这是一种多模态系统,结合触控输入和语音命令进行文本编辑。
- 创新地引入了一种触控位置感知的注意力机制,将用户的触摸位置直接集成到大型语言模型(LLM)的注意力层,指导模型关注需要编辑的文本区域。
-
创新之处:
- 引入触控位置感知注意力层,使LLM能够结合用户触摸的位置信息,调整其注意力权重,从而专注于需要修改的文本。
- 通过数据增强处理解决语音识别可能导致的字母大小写错误问题,实现更高的自动化编辑能力。
- 利用合成数据训练模型,以降低真实数据收集的成本和复杂性,同时实现广泛的泛化能力。
-
实施步骤与关键技术:
- 多模态输入:用户首先通过触摸指示需要编辑的位置,然后通过语音输入新的文本。触摸位置和语音命令被实时识别。
- 数据合成与增强:模拟用户触摸行为和语音表达,通过合成的数据生成训练样本。包括对语音文本大小写的随机反转以增强模型适应性。
- 触控位置感知注意力机制:将触摸位置编码为一个加权矩阵,在注意力层中引入该矩阵以指导模型的注意力权重分布。
- 模型微调:使用合成数据对预训练的 FLAN-T5 模型进行微调,以适应实际的文本编辑任务。
- 结果呈现与用户界面:模型生成多个校正候选结果,用户可以选择其中一个进行应用。
研究成果
-
具体成果:
- 作者的模型在文本校正任务中的 Top-1 准确率达到 96.1%,显著优于基线方法 VT 的 39.97%。
- 用户研究显示 Tap&Say 在完成任务时间(减少16.4%)和键盘点击次数(减少47.5%)上优于 VT,同时也显著优于 Voice Access(减少28.1%任务完成时间)。
-
与现有解决方案相比的优势:
- 精确定位:支持用户在整个句子中任意触摸,不像 VT 仅支持误差范围内的触摸。
- 高语义理解能力:利用LLM进行端到端结果生成,相较于传统的基于规则和简单语言模型的方法,表现更优。
- 自动化能力:能够自动处理大小写错误,无需用户手动调整。
- 高适应性:模型对ASR(自动语音识别)和多种文本错误类型表现出强大的泛化能力。
-
实验或评估结果:
- 用户研究中,Tap&Say的平均错误编辑时间为 5.65 秒,比 VT 和 Voice Access 更短。
- Tap&Say 在用户偏好、物理需求和心理需求评分中均显著优于基线方法,用户反馈突出其准确性、易用性以及自动处理字母大小写的能力。
-
局限性与未来方向:
- 模型当前仅支持单句编辑,处理多句或全文段落时可能缺乏训练数据支持。
- 合成数据尽管表现良好,但模型未针对语音识别错误进行特定优化,未来需要处理更真实的用户输入噪声。
- 系统目前依赖于云端LLM运行,在移动设备本地部署方面仍需进一步优化。
总结
Tap&Say 是一种结合语音和触控输入的多模态文本编辑系统,其主要创新是通过触控位置感知注意力机制和 LLM 实现智能语义驱动的编辑方式。在用户研究中表现出卓越的效率和用户喜爱度,为智能手机上的文本编辑体验带来了显著进步。这项研究为未来多模态交互系统的设计提供了有力的技术基础,并展示了 LLM 在人机交互场景中的巨大潜力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何在智能手机上区分语音文本输入与语音编辑指令?分类: 空间定位、轨迹恢复与位置信号方法同类问题arrow_forward
- 如何准确识别用户意图编辑的文本区域?分类: 空间定位、轨迹恢复与位置信号方法同类问题arrow_forward
- 结合触控输入和语音命令的多模态系统能否提高智能手机文本编辑的效率?分类: 空间定位、轨迹恢复与位置信号方法同类问题arrow_forward
lightbulb
现实痛点
1- 用户在智能手机上文本编辑效率低,常因光标定位和输入方式受限。分类: 空间定位、轨迹恢复与位置信号方法同类问题arrow_forward
- 75%
GestAKey: 个体键帽上的触控交互
CHI '18· 手部手势识别 +1
- 75%
LLMR:使用大型语言模型实时提示交互式世界
CHI '24· 混合现实工作空间 +1
- 75%
生成性和可塑性用户界面与生成性和演进的任务驱动数据模型
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 75%
观察,询问,干预:设计用于更包容性会议的AI代理
CHI '25· 大语言模型(LLM)的人机协作 +1
- 75%
内容驱动的本地响应:支持带有和不带有AI的句子级和消息级移动电子邮件回复
CHI '25· 语音用户界面(VUI)设计 +1
- 75%
为我做 vs. 与我一起做:研究功能丰富的软件副驾中不同自动化范式用户感知
CHI '25· 大语言模型(LLM)的人机协作 +1
- 75%
生成式AI对批判性思维的影响:来自知识工作者调查的自我报告的认知努力减少和信心效应
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 75%
GeneyMAP: 探索GenAI促进用户体验设计中用户旅程映射的潜力
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 75%
从操作到认知:从用户演示中自动建模认知依赖关系以实现GUI任务自动化
CHI '25· 大语言模型(LLM)的人机协作 +1
- 75%
探索大型语言模型中的移动触摸交互
CHI '25· 手部手势识别 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713376
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
9 位作者
sell
研究子方向
大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文