实验室中评估生成式AI:方法论挑战与指南

生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作用户研究方法(访谈、调查、观察)原型设计与用户测试HCI 研究员AI/ML 研究员与工程师

生成式AI(GenAI)系统本质上是非确定性的,即使对于相同的输入也会产生不同的输出。虽然这种可变性是其吸引力的核心,但它挑战了假设系统行为一致且可预测的传统HCI评估实践。因此,在这种条件下设计受控的实验室研究仍然是一项关键的方法论挑战。我们提供了四个基于实验室的GenAI集成原型用户研究的反思性多案例分析,涵盖对话式车载助手系统和设计工作流程的图像生成工具。通过跨案例反思和所有研究阶段的主题分析,我们识别了五种方法论挑战并提出了十八条实践导向建议,组织成五条指南。这些挑战代表了由于GenAI的随机性质而被放大、重新定义或新引入的方法论构念:(C1)对熟悉交互模式的依赖,(C2)保真度-控制权衡,(C3)反馈与信任,(C4)可用性评估差距,(C5)界面与系统问题之间的解释歧义。我们的指南通过重新定义 onboarding 以帮助参与者管理不可预测性、扩展具有信任和意图一致性的评估构造等策略来解决这些挑战,并记录系统事件(包括幻觉和延迟)以支持透明分析。这项工作贡献了(1)关于GenAI的随机性质如何动摇基于实验室的HCI评估的方法论反思,(2)帮助研究人员在受控环境中设计更透明、更稳健、更可比的GenAI系统研究的十八条建议。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/226634/2026

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
HCI 研究员、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文