SketchGPT:基于草图的多模态接口用于应用无关的LLM交互
作者
语音用户界面(VUI)设计大语言模型(LLM)的人机协作
人类与大语言模型(LLM)的交互通常局限于文本或图像界面。草图是表达创意想法和用户意图的强大媒介,但其潜力仍未得到充分探索。我们提出了SketchGPT,一种将草图和语音输入直接集成到系统界面的新型交互范式,促进与LLM的开放域、上下文感知通信。通过利用多模态输入的互补优势,表达式在保持效率的同时丰富了语义范围。在不同上下文和模态中解释用户意图仍然是一个关键挑战。为了解决这一问题,我们开发了一个基于多智能体框架的原型,该框架在上下文中推断用户意图,并生成可执行、上下文敏感和工具包感知的反馈。使用思维链技术进行时间和语义对齐,系统理解多模态意图并在人类确认后执行操作以确保可靠性。用户研究表明,SketchGPT显著优于单模态操作方法,提供了更直观和有效的LLM交互方式。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3746059.3747598
一眼看懂
fact_check论文快照
dataset
来源
UIST
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
12 位作者
sell
研究子方向
语音用户界面(VUI)设计、大语言模型(LLM)的人机协作
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
3 篇相关论文