EvAlignUX:通过LLM支持的指标探索提升用户体验评估
作者
研究背景与问题
-
作者发现的挑战: 用户体验(UX)评估在面对复杂性、不可预测性和人工智能(AI)生成能力时表现出诸多不足。传统的UX评估方法(如系统可用性量表SUS、用户体验问卷UEQ)无法充分捕获人机交互特别是人-AI互动中的动态性、社会性和多模态行为。
-
为什么重要: AI系统在用户交互中的角色正变得越来越重要,而评估这些系统是否满足用户需求以及利用其独特特性来改进系统仍存在巨大空白。更好地理解评估指标与预期研究结果的关系,可以改善用户的信任、参与感以及系统的社会影响。
-
研究动机: 当前缺乏一种工具来协助研究者选取适当的UX评估指标并制定综合的计划。虽然已有大量评估方法,但研究者仍面临如何从众多方法和指标中进行科学选择的困难。
解决方案
-
作者提出的解决办法: 作者开发了 EvAlignUX,一个基于大型语言模型(LLM)支持的互动工具,用于帮助用户体验研究者探索UX评估指标及其与研究结果的关联性。
-
创新之处:
- EvAlignUX 提供三个主要功能面板——项目构思面板(Project Ideation Panel)、指标探索面板(Metrics Explorer Panel)、以及影响与风险面板(Outcomes and Risks Panel)。
- 将UX评估指标和相关文献整合到交互系统中,帮助研究人员从已有研究中获取洞见,从而更有依据地选择合适的评估指标。
- 提供可视化指标图,帮助研究者发现指标之间的潜在联系。
-
实施步骤和关键技术:
- 用户输入项目描述、初步评价计划和预期结果。
- EvAlignUX 使用基于GPT-4的生成技术,通过知识图谱(Neo4j支持)推荐相关的评估指标和文献。
- 系统通过质询式和交互式界面提供多样化的评估视图,如列表视图和图表视图。
- 系统还整合了AI风险案例数据库,为用户提供潜在风险预警和研究成果参考建议。
研究成果
-
具体成果:
- EvAlignUX 改进了用户对UX评估计划的清晰度、完整性和信心。
- 系统引导参与者更加深入地思考研究的潜在影响和风险,形成了一套“UX问题库(UX Question Bank)”以指导后续开发。
-
与现有方案的比较和优势:
- 与传统方法相比,EvAlignUX 能够动态调整用户的指标选择,弥补研究者缺乏相关文献与经验的短板。
- 使用了诸如图形化交互界面和文献引用链接等增强特性,简化了指标探索过程,大幅提高了效率。
- 系统帮助参与者辨别未考虑的维度(如伦理风险、研究结果的可推广性)。
-
实验与评估:
- 19位用户体验研究人员的多阶段用户测试表明,EvAlignUX 提高了计划的感知质量(例如增加了42%的计划细化和风险考虑)。
- 系统特性如指标列表、图表以及预期结果模块被普遍认可为有用。
-
局限性及未来方向:
- 当前的知识库有限,仅涵盖了选定的人-AI交互研究主题,尚未完全覆盖多学科或行业案例。
- 尽管系统对初学者非常有效,但对有经验研究者的作用更倾向于验证而非启发。未来需要提供更细粒度的适应性功能。
- 对AI系统潜在依赖的风险需进一步研究,例如,通过触发式问题提示或动态反馈机制减轻依赖性。
通过引入LLM技术支持,EvAlignUX 显著改善了用户体验研究者的计划制定方式,无论在效率、认知支持还是潜在风险提前考虑上都有突破。其提出的从“方法中心”到“思维中心”的转变,为UX评估的设计和教育提出了新视野。同时,未来的改进方向,例如扩展工业应用和增强自我批判能力,将使其在更广泛的场景中发挥价值。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 如何改进传统用户体验(UX)评估方法,使其能够更好地适应人工智能(AI)交互中的复杂性和多模态行为?分类: 可视化评估方法与实证用户研究同类问题arrow_forward
- 交互式工具(如EvAlignUX)能否帮助UX研究者更高效地选择评估指标并制定评估计划?分类: 可视化评估方法与实证用户研究同类问题arrow_forward
- UX评估指标与研究期望结果之间的关联如何可视化呈现并被研究者有效利用?分类: 可视化评估方法与实证用户研究同类问题arrow_forward
现实痛点
1- 研究者难以科学选择用户体验评估指标,无法全面制定评估计划。分类: 可视化评估方法与实证用户研究同类问题arrow_forward
- 80%
'为什么《芝加哥》是误导性的?' 为人类构建模型驱动教程的尝试
CHI '20· 大语言模型(LLM)的人机协作 +2
- 80%
促进对大型语言模型的适当依赖:解释、来源和不一致性的角色
CHI '25· 大语言模型(LLM)的人机协作 +1
- 75%
COGAM:在机器学习模型解释中测量和调节认知负荷
CHI '20· 可解释人工智能(XAI)
- 75%
持续的人在环优化
CHI '25· 大语言模型(LLM)的人机协作
- 67%
生成式AI的元认知需求与机遇
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 67%
LLM时代的人类创造力:关于发散思维和收敛思维的随机实验
CHI '25· 大语言模型(LLM)的人机协作 +2
- 67%
故事的仿真:探讨大型语言模型作为定性研究参与者
CHI '25· 大语言模型(LLM)的人机协作 +2
- 67%
告诉我遗漏了什么:与GPT交互以回忆一次性目击事件
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
协作强化学习综述:交互方法与设计模式
DIS '21· 大语言模型(LLM)的人机协作 +2
- 67%
PersonaFlow:设计基于LLM模拟专家视角的研究构思增强系统
DIS '25· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)