利用大型语言模型大规模收集定性数据:一个案例研究
聊天机器人作为扩大定性数据收集规模的工具展现出潜力。大型语言模型(LLM)的最新进展可能允许研究人员轻松部署复杂的访谈聊天机器人,从而加速这一进程。我们通过开展大规模用户研究(n=399)来验证这一假设,评估三种不同的聊天机器人,其中两种基于LLM,一种采用硬编码问题的基线模型。我们从参与者参与度和体验、基于有效沟通理论的聊天机器人质量既定指标,以及评估「丰富性」或响应捕获研究社会情境复杂性和特异性的新量表来评估结果。我们发现,虽然聊天机器人能够根据既定评估指标引发高质量响应,但这些响应很少捕捉到参与者的特定动机或个性化案例,因此在丰富性方面表现不佳。我们还发现,在质量和丰富性指标的评估中,LLM与人类评估者之间存在较低的信度。我们的研究为利用LLM扩展和评估定性研究提供了警示故事。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
CSCW
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
—
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文