访谈驱动的生成代理用于产品发现:一项验证研究
荣誉提名大语言模型(LLM)的人机协作AI 辅助决策与自动化系统用户研究方法(访谈、调查、观察)原型设计与用户测试软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师HCI 研究员
文献标题
Interview-Informed Generative Agents for Product Discovery: A Validation Study
出版信息
- 主题领域: 生成式人工智能代理在产品发现和用户模拟中的应用。
- 关键词: 大型语言模型,生成式代理,产品发现,用户模拟,AI概念测试,技术接受模型,净推荐值,定性反馈,文档工作流,人机交互。
背景与问题
- 问题/挑战: 尽管大型语言模型(LLMs)在社会科学模拟中表现出了能力,但其在产品发现情境中的适用性仍不明确,尤其是在模拟用户对新概念的响应方面。
- 重要性: 理解用户对早期产品概念的反应对设计研究和产品开发至关重要,但传统方法资源消耗较大。
- 动机与相关工作: 先前研究(如 Park 等,2023)表明,LLMs 在复制调查响应方面具有较高的准确性,但其在产品发现中的效用——特别是为假设场景构建响应——尚未得到验证。本研究探讨了基于访谈的生成式代理是否能够模拟用户对 AI 概念的评估。
解决方案
- 提出的方法: 基于详细用户访谈的生成式代理,用于模拟对 AI 文档工作流概念的响应。
- 创新点:
- 首次对生成式代理在产品发现任务中的实证验证。
- 将模拟保真度描述为“分布校准但身份不精确”。
- 提供将模拟整合到产品开发工作流中的实践指导。
- 流程与关键技术:
- 对知识工作者进行深入访谈,以捕捉工作流和技术采用模式。
- 使用访谈记录创建个性化生成式代理。
- 使用定量(TAM、NPS)和定性指标比较代理响应与实际参与者响应。
- 在个体和群体层面评估模拟保真度。
结果
- 具体发现:
- 基于访谈的代理在个体层面的准确性上达到 67% 的人类-人类一致性,但无法可靠地复制特定参与者的响应。
- 代理在群体层面的响应分布上比仅使用草稿或无信息的基线对齐更好。
- 代理的开放式响应能够捕捉高层次主题,但缺乏细微差别、情感变化和体验保真度。
- 相较基线的优势:
- 基于访谈的代理在群体层面的对齐(Wasserstein 距离)上优于仅使用草稿或无信息的代理。
- 代理在响应分布中捕捉到现实的变化性,尤其是在负面反馈方面。
- 实验/评估:
- 研究涉及 51 名参与者,评估了四种 AI 文档工作流概念(Multidoc Q&A Assistant、Smart Highlights Assistant、Audio Assistant、Workflow Actions Assistant)。
- 指标包括 MAE、相关性、Gwet 的 AC2,以及定性评估(情感、解释、主题覆盖、语气)。
- 成本分析显示,代理模拟速度更快(每个概念 4 分钟)且成本更低(每个概念 $1.27),相比之下人工评估需要 30 分钟,成本为 $12.50。
- 局限性与未来工作:
- 小样本量(51 名参与者)限制了统计效能。
- 代理无法捕捉个体层面的保真度和细微的定性洞察。
- 未来工作应探索更丰富的模态、改进的代理架构,以及更大、更多样化的人群。
总结
本研究验证了基于访谈的生成式代理在产品发现情境中模拟用户响应的可行性。尽管代理在群体层面实现了校准和分布准确性,但在可靠复制个体层面响应方面表现不足。实际应用包括低成本概念筛选和早期设计阶段的方向性探索,但真实的用户访谈仍然是获取细致洞察的必要手段。未来研究应聚焦于改进代理架构,并扩展验证至多样化领域和模态。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
即时目标:一种用于专业人工智能交互的通用方法
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
DALL:基于数据编程和大型语言模型增强的主动学习进行数据标注
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
“让我来帮忙”:人与网络代理协作中用户干预的实证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
数据与提示词协同演化:通过扩展测试集优化大语言模型行为
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
隐形导师:从屏幕录制推断用户操作以推荐更好的工作流程
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
居于循环之中:面向提示的快速运行时反馈
CHI '26· 大语言模型(LLM)的人机协作 +3
- 78%
"我们是否要深入探讨?":为异步在线讨论中推进知识共建设计并评估LLM智能体策略
CHI '26· 大语言模型(LLM)的人机协作 +3
- 78%
“它成为了我的伙伴,但我敢于反对”:UX 评估员与对话式 AI 助手协作的多会话研究
CHI '26· 大语言模型(LLM)的人机协作 +4
- 78%
TurnStyle:一个分析人类对话行为以预测LLM辅助任务成功的框架
CHI '26· 大语言模型(LLM)的人机协作 +3
- 78%
ImpReSS:面向对话支持智能体的轻量级隐式推荐系统设计与评估
IUI '26· 大语言模型(LLM)的人机协作 +4
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791918
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
2 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文