ReactGenie:使用大型语言模型开发复杂多模式交互的框架
作者
语音用户界面(VUI)设计生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师
文献标题
ReactGenie: A Development Framework for Complex Multimodal Interactions Using Large Language Models
文献信息
- 主题领域: 人机交互,界面开发,多模态交互
- 关键词: 多模态交互, 开发框架, 编程框架, 大语言模型, 自然语言处理
研究背景与问题
- 发现的问题或挑战: 随着多模态交互(如触摸和语音)的发展,现有的框架要求开发者手动处理复杂命令,导致开发成本高、时间长。此外,语言交互的表达性和组合性实现困难。
- 重要性: 多模态交互可以增强用户界面的效率和用户体验,但开发繁复复杂多模态应用仍具有较高的技术门槛,限制了其广泛应用。
- 研究动机与相关工作: 存在的框架(如Redux、QuickSet等)多是单纯处理语音或图形接口,并缺乏对多模态命令组合操作的支持。因此,需要一种简化开发流程并促进多模态交互易于实现的新框架。
解决方案
- 提出的方法或解决方案: ReactGenie框架通过重新抽象界面层和计算模型,结合大语言模型(LLM),将用户的多模态命令解析为自定义领域编程语言(NLPL),并通过内部解释器实现命令的执行。
- 创新之处:
- 提出了对象分层状态抽象,支持多模态命令的自然组合,减少中间变量。
- 设计了NLPL编程语言和基于LLM的多模态命令解析模型,提高命令理解和语义解析的准确性。
- 自动化处理UI映射、语义解析和回馈生成,显著减少开发者工作量。
- 实施步骤与关键技术:
- 开发者编程: 使用开发者提供的对象状态类和UI组件定义功能,通过注释标记可访问功能。
- 框架初始化与生成模块: 自动生成语义解析模块和UI映射模块,通过大语言模型提取开发者功能。
- 运行时处理: 监听用户语音与触摸操作,将转录语音解析为NLPL代码,再通过解释器执行生成的代码,自动更新UI并生成文本反馈。
研究成果
- 具体成果:
- 开发了ReactGenie框架,为开发者提供简单易用的工具构建复杂多模态应用。
- 使用该框架开发了三个领域代表性应用(如食品订单、社交网络和NDA管理),展示了其在不同领域的适用性。
- 与现有解决方案相比的优势:
- 开发时间显著减少:对比GPT-3功能调用,ReactGenie减少了近75%的开发时间与效率。
- 提供高表达性:约90%的用户命令能够正确解析,显著高于传统语义解析框架。
- 实验或评估结果:
- 开发框架表现评估:
- 12名开发者平均2.5小时学会并完成构建演示应用。
- 用户交互测试:
- 使用者完成任务效率提高约50%(平均耗时从63.6秒减少到33.6秒)。
- 采用NASA-TLX与SUS标准评价认知负担降低,用户体验提高。
- 自然语言解析准确率可达90%,且没有出现完全错误的行为。
- 开发框架表现评估:
- 局限性与未来方向:
- 语音接口改进: 增加语音反馈功能与更自然的多轮对话支持。
- 开发工具增强: 减少解析示例数量,尝试自动生成示例代码。
- 更多模态支持: 扩展框架支持复杂手势与其他交互模态,例如图像处理和手势识别。
总结
ReactGenie框架展示了通过大语言模型支持复杂多模态交互的新方式。研究证明了ReactGenie的高效性、易用性以及用户交互的增强性。这项研究为未来多模态应用开发提供了新的思路,潜在推动人机交互领域的发展。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何在多模态交互中通过大语言模型简化开发流程并降低技术门槛?分类: GUI/IoT 任务自动化与界面生成同类问题arrow_forward
- 大语言模型能否通过定制编程语言提高用户命令的语义解析准确率?分类: GUI/IoT 任务自动化与界面生成同类问题arrow_forward
- ReactGenie框架如何提升多模态交互应用的开发效率和用户体验?分类: GUI/IoT 任务自动化与界面生成同类问题arrow_forward
lightbulb
现实痛点
1- 开发者难以高效实现复杂的语音与触控结合的多模态交互。分类: GUI/IoT 任务自动化与界面生成同类问题arrow_forward
- 83%
使用大型语言模型实现与移动UI的对话交互
CHI '23· 语音用户界面(VUI)设计 +1
- 83%
MUD:面向大规模和噪声过滤的现代风格UI建模UI数据集
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 83%
生成式AI的角色如何影响人机协作工作中价值感知
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 83%
Screen2Words:基于多模态学习的自动移动端UI摘要生成
UIST '21· 语音用户界面(VUI)设计 +1
- 71%
AI增强的头脑风暴:研究LLM在团队创意生成中的应用
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 71%
知识工作中的人工智能生成技术:数据导航和决策制定的设计影响
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 71%
超越代码生成:LLM支持的程序设计空间探索
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 71%
CARING-AI:通过生成式人工智能实现上下文感知的增强现实指令创作
CHI '25· AR 导航与情境感知 +2
- 71%
使用提示进行原型设计:协作软件团队在生成式AI设计中的新兴方法和挑战
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 71%
创建设计资源以支持AI概念的构思
DIS '23· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642517
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
10 位作者
sell
研究子方向
语音用户界面(VUI)设计、生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文