评估大型语言模型在生成合成HCI研究数据中的应用:一个案例研究
最佳论文大语言模型(LLM)的人机协作众包任务设计与质量控制软件工程师与开发者HCI 研究员
文献标题
Evaluating Large Language Models in Generating Synthetic HCI Research Data: A Case Study
文献信息
- 主题领域: 人机交互(HCI)研究,重点是利用大型语言模型(LLMs)生成合成研究数据
- 关键词: 用户体验, 用户模型, 语言模型, GPT-3, HCI仿真, 合成数据
研究背景与问题
-
问题与挑战:
- HCI研究中,收集真实用户数据(例如访谈和问卷)通常需要很高的成本和时间。
- 大部分计算用户建模局限于较简单的行为指标,难以捕获诸如用户情感、动机和复杂主观体验等方面。
- 合成数据能否在设计和验证中补充真实数据尚不清楚,并且当前尚未评估大型语言模型在HCI领域生成数据的质量。
-
重要性:
- 如果LLM能够高效生成类似真实的研究数据,它可能极大地加速HCI研究和实验的迭代过程。
- 但与此同时,LLMs可能被恶意用户滥用于生成伪造数据,影响研究的可靠性。
-
研究动机与相关工作:
- 本研究受限于前人的计算用户建模工作,尤其是对GPT-3在生成用户体验类数据中的潜力关注。
- 与以往研究聚焦于语言模型的逻辑能力不同,本研究核心关注其生成主观体验数据的真实性。
解决方案
-
方法或解决方案:
- 探索OpenAI的GPT-3模型生成合成数据的能力,通过问卷模拟人类参与者的用户体验回答。
- 检验其生成的文本是否可以被区分为“人工”或“计算生成”。
- 分析合成数据的错误类型,并比较GPT-3生成的内容与人类数据内容的差异。
-
解决方案的创新点:
- 首次对HCI领域中LLM生成的合成数据的真实性进行验证。
- 引入用于主题分析的自动化编码和生成的语义嵌入对比,评估合成数据与真实数据的结构差异。
- 提出多实验验证框架,包括数据区分能力实验、内容错误分析和统计相似性研究。
-
实施步骤与关键技术:
- 实验设计:
- 提出三个实验,分别评估生成数据的可识别性、错误种类及内容差异。
- 数据生成与处理:
- 使用GPT-3基于实验提示生成HCI领域的问卷回答。
- 与人类数据对比,通过定量与定性分析揭示一致性和差异。
- 定性与定量建模:
- 自动语义编码(包括主题挖掘、嵌入降维和群聚分析)。
- 使用Frechet距离等质量指标量化合成数据的“人性化”程度。
- 实验设计:
研究成果
-
具体成果:
- 实验1: 可识别性:
- 平均而言,参与者倾向于错误地将GPT-3生成的文本判定为"人工创作"(正确率~40.45%)。
- 实验2: 错误分析:
- 常见错误包括文本不连贯、编造事实、不回答问题等。
- 实验3: 数据内容差异:
- GPT-3生成文本在某些主题上与真实数据高度一致,如使用者对游戏的情感表达。
- 但也存在“多样性不足”的问题,例如对某些游戏的重复生成偏差。
- 实验1: 可识别性:
-
实验和评估结果:
- 与人类数据相比,最大的GPT-3模型(davinci)生成的数据在质量上更“人性化”。
- 评估认为,通过较少样本生成的主题分布和质量依赖于提示参数与具体模型版本。
- 实验揭示了最新的text-davinci-002模型生成内容质量较高,但内容多样性较低。
-
与现有解决方案的优势:
- 证明了LLM在生成主观用户体验数据方面的潜力,可用于HCI实验的初步探索或设计导航。
- 注重实验验证,弥补了语言模型相关研究中对生成内容可靠性评估的空白。
-
局限性与未来方向:
- 仅检验了游戏体验作为一种特定HCI背景,其他研究主题的推广效果未完全验证。
- 对提示词和生成策略的设计仍需进一步优化以提高模型适用性。
- 呼吁未来对LLM在不同用户群体、领域和文化背景下的数据生成能力进行更广泛的测试。
- 提到潜在滥用的风险,例如在线调查数据的真实性挑战,由此建议开发新型验证工具。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 大语言模型生成的合成数据在用户体验研究中的真实性如何?分类: 信息整理、文档分析与定性研究同类问题arrow_forward
- GPT-3生成的文本能否与人类创建的文本区分开?分类: 信息整理、文档分析与定性研究同类问题arrow_forward
- 生成的用户体验数据在主题分布和多样性上如何与真实数据相比?分类: 信息整理、文档分析与定性研究同类问题arrow_forward
lightbulb
现实痛点
1- HCI研究中收集真实数据成本高,耗时长。分类: 信息整理、文档分析与定性研究同类问题arrow_forward
- 100%
探索未知:面向个性化探索任务的聊天式协作界面
IUI '25· 大语言模型(LLM)的人机协作 +1
- 75%
MAPLE:利用大型语言模型嵌入的移动应用预测
UbiComp '24· 大语言模型(LLM)的人机协作
- 75%
LlamaTouch:一个可信且可扩展的移动UI任务自动化测试平台
UIST '24· 大语言模型(LLM)的人机协作
- 67%
AI作为智能体与协作空间:探索生成式AI在小团体同步与异步协作动态中的作用
CHI '26· 大语言模型(LLM)的人机协作 +2
- 60%
西塞罗:多轮次,上下文论证以实现精确众包
CHI '19· 大语言模型(LLM)的人机协作 +1
- 60%
情感聚焦:促进在线演示过程中观众成员情感反应的交流
CHI '21· VR 中的社交与协作 +1
- 60%
OneLabeler: 一个灵活的构建数据标注工具的系统
CHI '22· 众包任务设计与质量控制
- 60%
DynEx:具有结构化设计探索的动态代码合成以加速探索性编程
CHI '25· 大语言模型(LLM)的人机协作 +1
- 60%
SummAct:通过交互行为总结揭示用户意图
CHI '25· 大语言模型(LLM)的人机协作 +1
- 60%
发散还是收敛?基于熵的深度洞察:众包协作及其在开源软件中的生产力
CHI '26· 众包任务设计与质量控制 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3580688
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
最佳论文
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、众包任务设计与质量控制
work
职业/产业
软件工程师与开发者、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文