评估大型语言模型在生成合成HCI研究数据中的应用:一个案例研究

最佳论文
大语言模型(LLM)的人机协作众包任务设计与质量控制软件工程师与开发者HCI 研究员

文献标题

Evaluating Large Language Models in Generating Synthetic HCI Research Data: A Case Study

文献信息

  • 主题领域: 人机交互(HCI)研究,重点是利用大型语言模型(LLMs)生成合成研究数据
  • 关键词: 用户体验, 用户模型, 语言模型, GPT-3, HCI仿真, 合成数据

研究背景与问题

  • 问题与挑战:

    • HCI研究中,收集真实用户数据(例如访谈和问卷)通常需要很高的成本和时间。
    • 大部分计算用户建模局限于较简单的行为指标,难以捕获诸如用户情感、动机和复杂主观体验等方面。
    • 合成数据能否在设计和验证中补充真实数据尚不清楚,并且当前尚未评估大型语言模型在HCI领域生成数据的质量。
  • 重要性:

    • 如果LLM能够高效生成类似真实的研究数据,它可能极大地加速HCI研究和实验的迭代过程。
    • 但与此同时,LLMs可能被恶意用户滥用于生成伪造数据,影响研究的可靠性。
  • 研究动机与相关工作:

    • 本研究受限于前人的计算用户建模工作,尤其是对GPT-3在生成用户体验类数据中的潜力关注。
    • 与以往研究聚焦于语言模型的逻辑能力不同,本研究核心关注其生成主观体验数据的真实性。

解决方案

  • 方法或解决方案:

    • 探索OpenAI的GPT-3模型生成合成数据的能力,通过问卷模拟人类参与者的用户体验回答。
    • 检验其生成的文本是否可以被区分为“人工”或“计算生成”。
    • 分析合成数据的错误类型,并比较GPT-3生成的内容与人类数据内容的差异。
  • 解决方案的创新点:

    • 首次对HCI领域中LLM生成的合成数据的真实性进行验证。
    • 引入用于主题分析的自动化编码和生成的语义嵌入对比,评估合成数据与真实数据的结构差异。
    • 提出多实验验证框架,包括数据区分能力实验、内容错误分析和统计相似性研究。
  • 实施步骤与关键技术:

    1. 实验设计:
      • 提出三个实验,分别评估生成数据的可识别性、错误种类及内容差异。
    2. 数据生成与处理:
      • 使用GPT-3基于实验提示生成HCI领域的问卷回答。
      • 与人类数据对比,通过定量与定性分析揭示一致性和差异。
    3. 定性与定量建模:
      • 自动语义编码(包括主题挖掘、嵌入降维和群聚分析)。
      • 使用Frechet距离等质量指标量化合成数据的“人性化”程度。

研究成果

  • 具体成果:

    1. 实验1: 可识别性:
      • 平均而言,参与者倾向于错误地将GPT-3生成的文本判定为"人工创作"(正确率~40.45%)。
    2. 实验2: 错误分析:
      • 常见错误包括文本不连贯、编造事实、不回答问题等。
    3. 实验3: 数据内容差异:
      • GPT-3生成文本在某些主题上与真实数据高度一致,如使用者对游戏的情感表达。
      • 但也存在“多样性不足”的问题,例如对某些游戏的重复生成偏差。
  • 实验和评估结果:

    • 与人类数据相比,最大的GPT-3模型(davinci)生成的数据在质量上更“人性化”。
    • 评估认为,通过较少样本生成的主题分布和质量依赖于提示参数与具体模型版本。
    • 实验揭示了最新的text-davinci-002模型生成内容质量较高,但内容多样性较低。
  • 与现有解决方案的优势:

    • 证明了LLM在生成主观用户体验数据方面的潜力,可用于HCI实验的初步探索或设计导航。
    • 注重实验验证,弥补了语言模型相关研究中对生成内容可靠性评估的空白。
  • 局限性与未来方向:

    • 仅检验了游戏体验作为一种特定HCI背景,其他研究主题的推广效果未完全验证。
    • 对提示词和生成策略的设计仍需进一步优化以提高模型适用性。
    • 呼吁未来对LLM在不同用户群体、领域和文化背景下的数据生成能力进行更广泛的测试。
    • 提到潜在滥用的风险,例如在线调查数据的真实性挑战,由此建议开发新型验证工具。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/95751/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3580688
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
最佳论文
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、众包任务设计与质量控制
work
职业/产业
软件工程师与开发者、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文