StepWrite:用于语音驱动文本生成的适应性规划
人们经常使用语音转文本系统用声音撰写短文本。然而,当前的语音界面难以支持撰写更详细、上下文复杂的文本,特别是在用户正在移动且无法视觉跟踪进度的场景中。较长形式的通信,如撰写结构化电子邮件或深思熟虑的回复,需要持续的上下文跟踪、结构化指导和适应不断变化的用户意图的能力——这是传统听写工具和语音助手不支持的能力。我们引入StepWrite,一个由大型语言模型驱动的语音交互系统,通过在移动时实现结构化、无需动手且无需视觉的长文本撰写来增强人类写作能力。StepWrite将写作过程分解为可管理的子任务,并通过上下文感知的非视觉音频提示逐步引导用户。StepWrite通过将上下文跟踪和适应性规划任务卸载给模型来降低认知负荷。与基线方法(如Microsoft Word标准听写功能和对话式语音助手ChatGPT高级语音模式)不同,StepWrite根据不断变化的上下文和用户意图动态调整其提示,并在不损害用户自主性的情况下提供连贯指导。25名参与者参与移动或静止手持活动的实证评估表明,与基线方法相比,StepWrite显著降低了认知负荷,提高了可用性和用户满意度。技术评估进一步确认了StepWrite在动态上下文提示生成、准确语气对齐和有效事实核查方面的能力。这项工作强调了结构化、上下文感知的语音交互在增强日常多任务场景中无需动手和无需视觉的通信方面的潜力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 80%
使用大型语言模型实现与移动UI的对话交互
CHI '23· 语音用户界面(VUI)设计 +1
- 80%
Screen2Words:基于多模态学习的自动移动端UI摘要生成
UIST '21· 语音用户界面(VUI)设计 +1
- 67%
ReactGenie:使用大型语言模型开发复杂多模式交互的框架
CHI '24· 语音用户界面(VUI)设计 +2
- 67%
VoiceAlign:一个用于增强传统语音用户界面系统可用性的自适应中间层
IUI '26· 语音用户界面(VUI)设计 +2
- 60%
利用WorldGaze提升移动语音助手功能
CHI '20· 眼动追踪与注视交互 +1
- 60%
在配对编程环境中用代理替代人类的权衡:好的、坏的和丑的
CHI '21· 大语言模型(LLM)的人机协作 +1
- 60%
大规模可视化深度神经网络示例
CHI '21· 大语言模型(LLM)的人机协作 +1
- 60%
使用生成语言模型发现自然语言编程的语法和策略
CHI '22· 生成式AI(文本、图像、音乐、视频) +1
- 60%
AI Chains:通过链接大型语言模型提示实现透明且可控的人机交互
CHI '22· 大语言模型(LLM)的人机协作 +1
- 60%
通过数据工作的工件追踪和可视化人与ML/AI的协作过程
CHI '23· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)