通过与对话式AI助手合作增强用户体验评估:主动对话和时机的影响
大语言模型(LLM)的人机协作原型设计与用户测试计算方法在HCI中的应用UI/UX 设计师
文献标题
提升用户体验 (UX) 评估的对话式人工智能助手协作:主动对话和时间影响
文献信息
- 主题领域: 用户体验(UX)评估与人机协作
- 关键词: 用户体验,易用性测试,人机协作,对话式助手,主动对话,时间优化
研究背景与问题
-
问题与挑战:
- 传统的用户体验(UX)测试视频分析过程复杂且费时,容易导致信息遗漏或对可用性问题的误判。
- AI 辅助分析工具虽已被研究,但大多数工具使用的是用户驱动的交互模式,即仅在用户询问时系统才回应,而系统主动对话的潜力尚不明确。
-
重要性:
- 借助人工智能(AI)技术,分析用户体验测试视频是一种潜在的高效手段,有望缓解工业实践中的时间和资源压力。
- 研究对话式人工智能助手的主动对话功能及最佳建议时机,可以指导未来工具的设计,从而增强 AI 辅助决策能力和协作效率。
-
研究动机:
- 回应 Jakob Nielsen 提出的将 AI 纳入 UX 研究的倡议,探索主动对话式助手通过自动建议如何为 UX 评估提供支持。
- 重点研究建议出现的最佳时机(问题发生之前、同时或之后)的影响。
解决方案
-
方法与创新:
- 提出并使用一种主动对话式助手(Conversational Assistant, 简称 CA),通过三种不同的时机(问题前、同步出现、问题后)向 UX 评估者提供自动问题建议。
- 引入 ChatGPT 模型生成可用性问题建议,结合“向导式巫师”(Wizard of Oz)的实验设计方案,在实际条件下模拟真实的 CA 交互。
- 使用时间固定的建议显示策略,避免 AI 提示在非预期时刻打断用户,结合明确的建议内容(如问题描述和时间戳)。
-
实施步骤和技术:
- 使用 ChatGPT 生成易用性测试视频中的问题建议,并由 UX 专家进行初步质量评估。
- 设计带有视频播放器和聊天界面的 UX 分析工具,工具包含用户与 CA 交互的多种功能,如记录问题、回应建议等。
- 执行一项包含 24 名 UX 评估者的受控实验,测试不同时间条件下的主动建议对用户行为和分析结果的影响。
- 使用混合方法(定量与定性分析)分析实验数据,包括对 ChatGPT 问题建议的精确度与召回率测评,以及用户反馈调查。
研究成果
-
具体成果:
- 自动建议的时机对分析表现(确定问题数量)无显著影响。
- 大多数参与者更偏好在潜在问题发生后提供的建议("after" 条件),这一时机显著提升了信任和效率评分。
- 77.6% 的 ChatGPT 提供的建议被参与者接受,但同时也发现了该模型漏掉了 58.8% 的总问题(由参与者识别的所有问题而非 ChatGPT 诊断出的)。
-
与现有解决方案的比较与优势:
- 主动对话比用户驱动的交互更能增强用户的信任感,并在适当时机提供效率提升。
- ChatGPT 的建议起到了验证用户分析的作用,但并未取代 UX 评估者的专业判断。
-
实验与评估结果:
- 在“after”条件下,参与者对建议的接受度显著高于其他条件(达到 88.1% 的接受率)。
- 针对 ChatGPT 建议的典型反应包括同意、纠正、寻求澄清以及不同意或忽视。
-
局限性与未来方向:
- 局限性:
- ChatGPT 仅基于文本转录信息分析,无法捕捉视频中多模态线索(如面部表情、用户行为)。
- 实验情境可能未覆盖所有 UX 测试场景的复杂性。
- 未来方向:
- 为对话式助手加入多模态视频分析能力(如结合视频图像和音频数据),以更全面捕捉用户行为和感受。
- 探索更个性化的建议时机,如允许用户调整建议延迟。
- 开展纵向研究以观察 UX 评估者的长时间行为模式变化。
- 深入研究 AI 能力的透明度呈现及合适的人-AI 协作模式,减少误导与专业知识依赖的不平衡。
- 局限性:
这项研究提供了关于人机协作和时间优化设计的重要见解,为未来开发更加智能、高效的 UX 评估辅助工具提供了启示。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 会话式人工智能助手中的主动对话功能能否提升用户体验评估的效率和信任感?分类: 对话式 AI 与聊天机器人中的信任同类问题arrow_forward
- 在用户体验评估中,不同时间点提供的自动建议(问题发生前、发生时、发生后)对分析效果有何影响?分类: 对话式 AI 与聊天机器人中的信任同类问题arrow_forward
- 会话式人工智能助手生成的建议能在多大程度上被用户接受并支持专业判断?分类: 对话式 AI 与聊天机器人中的信任同类问题arrow_forward
lightbulb
现实痛点
1- 传统的用户体验测试视频分析繁琐且易遗漏问题。分类: 对话式 AI 与聊天机器人中的信任同类问题arrow_forward
- 75%
通过容错延迟控制性能
CHI '19· 原型设计与用户测试 +1
- 75%
SimUser:通过模拟各种用户与移动应用程序的交互来生成可用性反馈
CHI '24· 大语言模型(LLM)的人机协作 +1
- 67%
注意方式才是真正重要的:使用区分性变化实例化UI组件
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
Athena:用于迭代式支架式应用生成的LLM中间表示
IUI '26· 大语言模型(LLM)的人机协作 +2
- 60%
使用众包和深度学习建模移动界面的可点击性
CHI '19· 原型设计与用户测试 +1
- 60%
在图标网格中建模完全和部分约束的Lasso运动
CHI '19· 原型设计与用户测试 +1
- 60%
ORCSolver:一个用于具有OR约束的自适应GUI布局的有效求解器
CHI '20· 原型设计与用户测试 +1
- 60%
调查网页设计的同质化:一种混合方法论
CHI '21· 原型设计与用户测试 +1
- 60%
Varv:作为声明性数据结构的可重新编程交互软件
CHI '22· 原型设计与用户测试 +1
- 60%
学习去噪原始移动UI布局以大规模改进数据集
CHI '22· 原型设计与用户测试 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642168
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、原型设计与用户测试、计算方法在HCI中的应用
work
职业/产业
UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文