故事的仿真:探讨大型语言模型作为定性研究参与者
荣誉提名作者
研究背景与问题
-
作者发现了哪些问题或挑战? 本研究探讨大语言模型(LLMs),特别是它们在定性研究中的应用,这些模型被用作合成的研究参与者取代真实的人类参与者。主要问题在于这是否符合定性研究的核心目标和伦理要求,包括隐私、参与者的自治性以及知识生产的真实性。
-
为什么这个问题很重要? 传统的定性研究深耕于与人类参与者的互动,旨在挖掘深刻和细致的文化、社会和情感背景。而LLMs的出现,尽管可以减少研究时间和成本,但可能带来的伦理和知识生成问题将对学术界的核心价值产生潜在影响。
-
研究动机与相关工作 随着生成式人工智能的普及,许多研究开始讨论LLMs在定性研究中的潜在用途。一些工作展示了其在文本生成、问卷调查甚至伦理分析中的作用,但它们可能面临训练数据偏差、简化复杂性等问题。作者旨在通过深入定性研究者的观点,分析LLMs在替代研究参与者中的局限性及伦理挑战。
解决方案
-
作者提出了哪些方法或解决方案? 作者设计了一种探究性方法,通过与定性研究者的深入访谈,以及引入相关实验工具(模拟的LLM访谈探针),系统分析LLMs在定性研究中的应用效果和伦理挑战。
-
该解决方案的创新之处是什么? 研究并非单纯测试LLMs的能力,而是通过反思性讨论发掘LLMs与定性研究方法论和伦理之间的深层张力。提出了六大局限性,并运用通过STS(科学技术研究)和定性研究理论帮助解释这些问题。
-
实施步骤是什么?使用了哪些关键技术?
- 与具有半结构化访谈经验的19位定性研究者进行半结构化访谈。
- 使用一种编程工具(GPT-4-turbo API)模拟虚拟访谈,通过prompt定义不同的人物背景。
- 分析参与者使用LLMs生成数据时的行为、对比输出质量,以及对LLMs在研究情境中伦理和实际效用的评价。
- 定性分析数据以识别主题,包括对LLMs局限性的深刻观察与质疑。
研究成果
-
取得了哪些具体成果? 作者总结了六大LLMs应用的核心局限性:
- 缺乏感知真实性(palpability): 生成的内容虽涵盖一定细节,但缺乏真实参与者提供的动态性和细腻性。
- 模型的认知框架模糊: 生成数据可能整合对立论点,导致视角模糊且偏离文脉。
- 强化了研究者的偏见(positionality): 研究者对prompt的编写会无意中加强研究者的假设,导致数据偏向“符合预期”。
- 缺乏参与者的知情同意与自主性: 生成内容可能包含未经许可获取的数据,损害隐私权。
- 社区观点的消隐: 模型可能曲解或简化边缘化群体的复杂体验,把文化身份降级为刻板陈述。
- 定性知识的合法性受到威胁: 定性研究本已边缘化,LLMs可能进一步弱化其学术地位,转向快速数据生成的量化方法。
-
与现有解决方案相比,它有哪些优势? 本研究跳脱单纯技术指标对比,通过反思定性研究的理论根基,从伦理和知识论层面更深入挖掘LLMs在研究领域可能带来的风险。其多角度访谈揭示了实验室测试难以观察到的研究者与模型交互时的细微感受与漏洞。
-
实验或评估结果是什么? 研究表明,大多数参与者对模拟访谈数据的细腻度和可靠性感到不满。模型生成的内容看似合理,却缺乏对复杂社会和文化背景的扎实承接。这种表面上的有用性可能对研究信任和社区合作造成长期威胁。
-
局限性与未来方向
- 研究参与者多为学术背景,可能无法完全涵盖非学术领域的视角。
- 测试集中使用GPT-4,但未对其他模型或定制类型进行验证。
- 引导了若干场景下LLMs可能的辅助用途,如教学工具和试运行中,但这些也需要经过伦理学和应用有效性的更深层验证。
- 未来研究可以扩展至多文化背景下LLMs的参与行为和社区认可度。
通过分析,这篇研究是一项对LLMs介入定性研究领域的前瞻性评估。研究清楚表明,尽管LLMs具有文本生成的潜力,但其应用受到深刻的局限性限制,尤其在涉及敏感主题和社会群体语境时。研究为科技与人本主义之间的辩证关系提供了宝贵的见解。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 大语言模型(LLMs)在定性研究中作为合成研究参与者时,能否实现定性研究的核心目标和伦理要求?分类: 信息整理、文档分析与定性研究同类问题arrow_forward
- 定性研究者如何看待使用LLMs替代真实参与者的局限性和伦理挑战?分类: 信息整理、文档分析与定性研究同类问题arrow_forward
- LLMs生成的数据在深度和可靠性上与真实访谈数据相比存在何种差距?分类: 信息整理、文档分析与定性研究同类问题arrow_forward
现实痛点
1- 研究者在定性研究中难以平衡效率提升和伦理问题。分类: 信息整理、文档分析与定性研究同类问题arrow_forward
- 71%
PersonaFlow:设计基于LLM模拟专家视角的研究构思增强系统
DIS '25· 生成式AI(文本、图像、音乐、视频) +2
- 67%
作为AI语言模型,我无法:“调查LLM对用户请求的否认”
CHI '24· 大语言模型(LLM)的人机协作 +1
- 67%
EvAlignUX:通过LLM支持的指标探索提升用户体验评估
CHI '25· 大语言模型(LLM)的人机协作 +1
- 63%
全接受,无拒绝:评估大型语言模型作为「同行」评审者的表现
CHI '26· 大语言模型(LLM)的人机协作 +3
- 63%
使用 GPT 对话智能体模拟人群选择行为与偏见
CHI '26· 大语言模型(LLM)的人机协作 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)