实验室中评估生成式AI:方法论挑战与指南
作者
生成式AI(GenAI)系统本质上是非确定性的,即使对于相同的输入也会产生不同的输出。虽然这种可变性是其吸引力的核心,但它挑战了假设系统行为一致且可预测的传统HCI评估实践。因此,在这种条件下设计受控的实验室研究仍然是一项关键的方法论挑战。我们提供了四个基于实验室的GenAI集成原型用户研究的反思性多案例分析,涵盖对话式车载助手系统和设计工作流程的图像生成工具。通过跨案例反思和所有研究阶段的主题分析,我们识别了五种方法论挑战并提出了十八条实践导向建议,组织成五条指南。这些挑战代表了由于GenAI的随机性质而被放大、重新定义或新引入的方法论构念:(C1)对熟悉交互模式的依赖,(C2)保真度-控制权衡,(C3)反馈与信任,(C4)可用性评估差距,(C5)界面与系统问题之间的解释歧义。我们的指南通过重新定义 onboarding 以帮助参与者管理不可预测性、扩展具有信任和意图一致性的评估构造等策略来解决这些挑战,并记录系统事件(包括幻觉和延迟)以支持透明分析。这项工作贡献了(1)关于GenAI的随机性质如何动摇基于实验室的HCI评估的方法论反思,(2)帮助研究人员在受控环境中设计更透明、更稳健、更可比的GenAI系统研究的十八条建议。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 83%
AI of Oz:利用人工智能辅助人工Moderator增强人机交互中的Wizard of Oz研究
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
生成式AI应用程序的设计原则
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
探索巫师之路:人机交互中Oz方法的系统综述
CHI '26· 参与式设计(Participatory Design) +3
- 71%
基于反事实回放和混合Wizard-of-Oz的多模态生成式AI实时代理原型设计
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
交互增强指令:建模人-GenAI协作中提示与交互的协同作用
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
从丢弃到带走:生成式人工智能与氛围编程如何加速不同技术水平的原型开发
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
当设计师出汗时:GenAI协同创作的行为痕迹
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
从叙事到数字:利用大语言模型评估调查问卷
IUI '26· 大语言模型(LLM)的人机协作 +2
- 71%
Rationalizer:利用大语言模型支持用户为Likert量表问卷评分提供理由
IUI '26· 大语言模型(LLM)的人机协作 +2
- 67%
多重并行短语建议对母语和非母语英语作家电子邮件输入和写作行为的影响
CHI '21· 生成式AI(文本、图像、音乐、视频) +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)