PhraseFlow:短语级输入的设计与实证研究
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作AI 辅助创意写作软件工程师与开发者UI/UX 设计师
文献标题
PhraseFlow: Designs and Empirical Studies of Phrase-Level Input
文献信息
- 主题领域: 人机交互、文本输入技术
- 关键词: 文本输入,自动校正,短语输入,键盘,视觉反馈,用户研究
研究背景与问题
- 发现的问题或挑战:
- 当前的自动校正技术主要基于单词级的解码,存在错误校正和空间相关错误处理不佳等问题。
- 在单词级解码中,键盘无法通过后续输入的上下文信息改善校正准确性。
- 重要性:
- 提高手机键盘的文本输入准确性和用户体验对改善移动设备的交互效率至关重要。
- 短语级输入有潜力解决单词级解码的局限性。
- 研究动机与相关工作:
- 现有研究(如 VelociTap)显示短语级解码可能带来更高的文本输入准确性,但对用户行为和交互设计的研究较少。
- 此外,短语级输入涉及用户认知负荷的问题,需要优化设计。
解决方案
- 提出的解决方法:
- 开发了一种名为 PhraseFlow 的键盘原型,支持基于短语级解码的输入。
- 该键盘能够利用后续输入的上下文信息对之前输入的文本进行更准确的校正。
- 创新之处:
- 缓冲式提交方法 (Buffer Commit Method): 在输入多词短语后,逐步提交矫正结果,而非一次性提交。
- 实时纠正反馈: 在用户继续输入时提供实时文本纠正结果,这样减少了用户因未校正文本的不确定性产生的注意力分散。
- 优化视觉反馈设计: 使用下划线标记活动文本和闪光提示突出校正的变化,满足用户对系统状态的认知需求。
- 实施步骤和关键技术:
- 修改 Gboard 现有的有限状态传导器 (FST) 解码器以支持短语级解码。
- 应用多种设计方案,优化提交方式、建议显示和纠正效果。
- 进行多轮模拟与实验,验证改进后的设计对校正准确性和用户体验的影响。
研究成果
- 具体成果:
- 测试显示,PhraseFlow 的短语级解码比单词级解码的词错误率(Word Error Rate, WER)改善了 16.6%。
- 缓冲式提交方法显著降低了用户的认知负荷,使 PhraseFlow 在输入速度和准确度上接近商业键盘水平。
- 与现有解决方案的比较:
- PhraseFlow 在处理空间键引起的错误和利用后续上下文校正错误方面,有显著优势。
- 相较于现有的单词级解码器,PhraseFlow 提供了更少的错误校正和更高的用户接受度。
- 实验与评估结果:
- 实验 1 (设计优化): 确定了在背景闪光和下划线显示为主的视觉反馈效果。
- 实验 2 (模拟测试): 确认短语解码方法可降低错误率。
- 实验 3 (实验室测试 V1): 发现首版设计认知负荷高,需优化。
- 实验 4 (实验室测试 V2): 带缓冲提交与实时纠正反馈的 V2 原型使速度和错误率媲美 Gboard,错误率减少 19%。
- 实验 5 (实际使用): 42 名用户的六天使用中,约 78.6% 用户表示愿意在未来键盘中使用短语级输入功能;仅 7.1% 用户表示不喜欢。
- 局限性与未来方向:
- 局限性:
- 当前语言模型规模较小,未支持多语言或手势输入。
- 部分用户对纠正信任不足,错误改回过程复杂。
- 未来方向:
- 开发更大规模、基于深度学习的语言模型。
- 优化纠正方法以更高效地处理错误。
- 探索短语级手势输入及多语言环境的适用性。
- 局限性:
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 短语级解码能否提高移动键盘的自动纠错精度?分类: 输入性能、误触控制与交互效率同类问题arrow_forward
- 用户在使用支持短语级输入的键盘时,其输入速度和认知负担如何变化?分类: 输入性能、误触控制与交互效率同类问题arrow_forward
- 哪种视觉反馈设计最适合短语级输入的用户体验需求?分类: 输入性能、误触控制与交互效率同类问题arrow_forward
lightbulb
现实痛点
1- 移动键盘纠错精度低,无法利用上下文导致用户体验差。分类: 输入性能、误触控制与交互效率同类问题arrow_forward
- 80%
生成性和可塑性用户界面与生成性和演进的任务驱动数据模型
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 80%
生成式AI对批判性思维的影响:来自知识工作者调查的自我报告的认知努力减少和信心效应
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 80%
GeneyMAP: 探索GenAI促进用户体验设计中用户旅程映射的潜力
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 80%
Promptify:基于大语言模型的交互式提示词探索实现文本到图像生成
UIST '23· 生成式AI(文本、图像、音乐、视频) +2
- 71%
DreamGarden: 一个从单一提示生成游戏的设计助手
CHI '25· 脑机接口(BCI)与神经反馈 +3
- 71%
GenUI 研究:探索生成式 UI 工具的设计以支持用户体验从业者及更广泛领域
DIS '25· 生成式AI(文本、图像、音乐、视频) +2
- 67%
Stylette:用自然语言为网页设计样式
CHI '22· 沉浸感与临场感研究 +2
- 67%
选择与控制:用户如何使用叙事性和非叙事性提示与大型语言模型进行写作
CHI '23· 大语言模型(LLM)的人机协作 +1
- 67%
MUD:面向大规模和噪声过滤的现代风格UI建模UI数据集
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 67%
塑造人机协作:与语言模型共同写作中的不同支架水平
CHI '24· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445166
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、AI 辅助创意写作
work
职业/产业
软件工程师与开发者、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文