“它成为了我的伙伴,但我敢于反对”:UX 评估员与对话式 AI 助手协作的多会话研究
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统会话代理的人格与拟人化用户研究方法(访谈、调查、观察)原型设计与用户测试UI/UX 设计师HCI 研究员AI/ML 研究员与工程师
文献标题
“It Became My Buddy, But I’m Not Afraid to Disagree”: A Multi-Session Study of UX Evaluators Collaborating with Conversational AI Assistants
出版信息
- 主题领域: 可用性分析中的人机协作
- 关键词: 用户体验评估,对话式人工智能,新手-专家范式,人机协作,可用性测试,纵向研究,对人工智能的信任,人工智能专业性,评估者行为,人工智能辅助决策
背景与问题
- 问题/挑战: 完全自动化的可用性分析往往无法捕捉需要人类上下文理解的复杂或微妙问题,而以往关于人机协作的研究多为短期研究,忽视了信任和行为随时间的演变,以及对人工智能专业性的感知如何影响协作。
- 重要性: 理解用户体验评估者如何适应人工智能工具,以及人工智能专业性如何影响可用性分析,可以提升人机协作在真实场景中的有效性和可靠性。
- 动机与相关工作: 先前研究探讨了利用可视化工具和对话式助手(CAs)进行人工智能辅助的可用性分析,但尚未涉及纵向动态或不同人工智能专业性水平的影响。本研究基于新手-专家框架,旨在填补这些研究空白。
解决方案
- 提出的方法: 开发一款可用性分析工具,配备两个定制的对话式人工智能助手(新手和专家),以模拟不同的用户体验专业性水平,并通过多次会话的被试内实验进行评估。
- 创新点:
- 纵向研究设计,捕捉评估者行为和态度在五次会话中的变化。
- 比较新手和专家对话式助手,评估对人工智能专业性的感知对可用性分析的影响。
- 集成针对用户体验评估任务的自动化建议和响应。
- 流程与关键技术:
- 使用GPT-4V模拟新手和专家对话式助手,通过定制提示反映不同的用户体验专业性水平。
- 进行被试内实验,12名用户体验评估者在三种条件下(无CA、新手CA、专家CA)分析15个可用性视频,跨五次会话。
- 收集行为数据(如视频回放策略、建议接受率)、分析性能指标(如问题覆盖率、评估者间一致性)和主观反馈(如信任感、感知效率)。
结果
- 具体发现:
- 专家CA在精确度(93%)、召回率(76%)和响应准确性(88%)方面均优于新手CA(精确度:80%,召回率:54%,准确性:73%)。
- 与新手CA(6.6个问题/视频)和无CA(5.5个问题/视频)相比,参与者在使用专家CA时发现了更多的可用性问题(8.2个问题/视频)。
- 评估者间一致性(Fleiss’ kappa)在专家CA条件下最高(0.62),其次是新手CA(0.58)和无CA(0.40)。
- 相较基线的优势:
- 两种CA在问题发现、覆盖率和一致性方面均显著优于无CA条件。
- 专家CA在效率、可信度和建议的完整性方面显著高于新手CA。
- 实验/评估:
- 研究设计: 被试内实验,每位参与者五次会话,三种条件(无CA、新手CA、专家CA)。
- 指标: 精确度、召回率、响应准确性、问题覆盖率、Fleiss’ kappa、信任、效率和信心的Likert量表评分。
- 数据集: 15个可用性视频,涵盖三种产品(桌面网站、智能手机应用、VR头显)。
- 局限性与未来工作:
- 样本量有限(12名参与者),且可能存在性别偏差(10名女性,2名男性)。
- 需要进一步研究新手CA如何提升评估者技能,以及CA的性格特质如何影响协作。
- 未来研究可探索多CA协作和随用户专业性变化的自适应人工智能系统。
总结
本研究通过多次会话的实验,探讨了用户体验评估者如何适应人工智能工具,以及对人工智能专业性的感知如何影响可用性分析。结果表明,与新手CA和无CA条件相比,专家CA显著提升了问题发现、信任感和效率。参与者的行为随时间演变,从两遍策略转向一遍策略,信任和效率在初期的新奇效应后逐步恢复。研究结果凸显了专家CA在提升可用性评估中的潜力,以及新手CA作为培训工具的价值。未来工作应进一步探索自适应和多CA系统,以优化人机协作。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 78%
访谈驱动的生成代理用于产品发现:一项验证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 78%
即时目标:一种用于专业人工智能交互的通用方法
CHI '26· 大语言模型(LLM)的人机协作 +3
- 78%
计算机使用代理用户体验设计空间的映射
IUI '26· 大语言模型(LLM)的人机协作 +4
- 75%
我的聊天机器人是否有议程?理解类人聊天机器人交互中的人类与人工智能主体性
CHI '26· 会话代理的人格与拟人化 +2
- 75%
DuetUI:面向任务导向接口的人机协同生成双向上下文循环
CHI '26· 大语言模型(LLM)的人机协作 +2
- 75%
氛围检查:理解基于 LLM 的对话代理人格与对齐对目标导向任务中用户感知的影响
CHI '26· 会话代理的人格与拟人化 +2
- 75%
教学-学习交互:智能系统中支持反思性用户主体性的交互设计新概念
DIS '21· 大语言模型(LLM)的人机协作 +2
- 67%
DALL:基于数据编程和大型语言模型增强的主动学习进行数据标注
CHI '26· 大语言模型(LLM)的人机协作 +3
- 67%
Perspectra:选择专家增强多智能体研究创意生成中的批判性思维
CHI '26· 大语言模型(LLM)的人机协作 +3
- 67%
“让我来帮忙”:人与网络代理协作中用户干预的实证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790536
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、会话代理的人格与拟人化、用户研究方法(访谈、调查、观察)
work
职业/产业
UI/UX 设计师、HCI 研究员、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文