基于反事实回放和混合Wizard-of-Oz的多模态生成式AI实时代理原型设计
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作原型设计与用户测试UI/UX 设计师AI/ML 研究员与工程师HCI 研究员
文献标题
Prototyping Multimodal GenAI Real-Time Agents with Counterfactual Replays and Hybrid Wizard-of-Oz
出版信息
- 主题领域: 多模态生成式人工智能实时代理的原型设计与评估方法。
- 关键词: 多模态生成式人工智能(Multimodal GenAI)、实时代理、反事实回放、混合式巫师实验(Hybrid Wizard-of-Oz)、提示工程、以用户为中心的设计、人机交互(HCI)、主动系统、迭代原型设计、评估工具包。
背景与问题
- 问题/挑战: 现有的多模态生成式人工智能系统的原型设计与评估方法不足以应对领域特定任务中所需的情境复杂性、上下文即时性和实时交互。
- 重要性: 解决这些挑战对于开发能够在真实工作流程中有效协助用户的主动、上下文感知的人工智能代理至关重要。
- 动机与相关工作: 之前的方法(如提示工程、提示链和基准测试)主要关注基于文本或预定义任务,缺乏对多模态、时间敏感交互的支持。工具如巫师实验和回放演练提供了部分解决方案,但未能解决实时多模态系统的独特挑战。
解决方案
- 提出的方法: 提出一种新的原型设计流程,结合反事实视频回放提示和混合式巫师实验方法,用于迭代设计和优化多模态生成式人工智能代理的行为。
- 创新点:
- 引入反事实视频回放提示,通过记录的用户会话进行沉浸式、上下文丰富的提示策略评估。
- 改进混合式巫师实验方法,用于实时用户会话测试,支持提示的实时评估与优化。
- 开发模块化、开源的反事实回放工具包,用于快速原型设计多模态生成式人工智能行为。
- 演示通过迭代提示分解与优化提升实时代理性能。
- 流程与关键技术:
- 使用记录的用户会话,通过反事实视频回放提示测试和优化提示。
- 过渡到实时用户会话,采用混合式巫师实验设置,在实时交互中实现人工监督与干预。
- 迭代性地将提示重构为更小、更专用的模块(如任务阶段分类和消息生成)。
- 通过回放和实时会话评估循环验证优化效果。
结果
- 具体发现:
- 将单一、冗长的系统提示分解为专用提示,提高了消息的相关性和与用户需求的匹配度。
- 将任务阶段分类与消息生成分离,减少了分类错误并提升了后续支持质量。
- 第二轮混合式巫师实验循环的设计结果评分显著提高(M = 4.4, SD = 0.5),相比第一轮循环(M = 1.6, SD = 0.9)。
- 相较基线的优势:
- 反事实回放提供了比表格评估更丰富的情境上下文,有助于更好地评估提示的有效性。
- 混合式巫师实验会话揭示了实时分类错误,并允许即时修正,而这些在仅使用记录数据时无法实现。
- 实验/评估:
- 使用15个记录的用户会话和10个实时用户会话,在Autodesk Fusion360中的机械设计任务中进行迭代评估。
- 测量设计结果(如结构稳健性、间隙)并通过视频交互分析用户交互。
- 局限性与未来工作:
- 由于聚焦于单一领域(机械设计),通用性有限。
- 混合式巫师实验会话中对人工监督的依赖导致可扩展性挑战。
- 实时会话评估中可能存在巫师偏差和可重复性问题。
- 未来工作包括将方法集成到现有工具中,扩展到其他领域,以及自动化干预时机。
总结
本文提出了一种针对多模态生成式人工智能实时代理的新型原型设计流程,结合反事实视频回放提示和混合式巫师实验方法。这些方法通过迭代优化提示和系统行为,解决了实时、上下文敏感交互中的挑战。通过开发SocraBot(一个主动设计支持代理)验证了这些方法,展示了其在满足用户需求和提升设计结果质量方面的改进。开源的反事实回放工具包为人机交互研究人员和实践者提供了一个实用资源,用于在不同领域中原型设计和评估多模态生成式人工智能系统。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
生成式AI应用程序的设计原则
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 100%
交互增强指令:建模人-GenAI协作中提示与交互的协同作用
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 100%
当设计师出汗时:GenAI协同创作的行为痕迹
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 86%
通过语义指导桥接UI生成中的鸿沟
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 83%
可以使用AI吗?使用合作上下文强盗进行设计构思
CHI '19· 生成式AI(文本、图像、音乐、视频) +2
- 83%
用户体验设计研究中的生成式人工智能:UX 从业者、团队和公司如何在行业中使用 GenAI?
DIS '24· 生成式AI(文本、图像、音乐、视频) +2
- 83%
GANzilla:在生成对抗网络中实现用户驱动的方向发现
UIST '22· 生成式AI(文本、图像、音乐、视频) +1
- 71%
关于UX从业者在设计实际企业ML系统中的角色研究
CHI '22· 大语言模型(LLM)的人机协作 +2
- 71%
AI增强的头脑风暴:研究LLM在团队创意生成中的应用
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 71%
使用提示进行原型设计:协作软件团队在生成式AI设计中的新兴方法和挑战
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790800
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、原型设计与用户测试
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文