LAPS:使用大型语言模型自动化公共调查的假设驱动统计分析
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统可解释人工智能(XAI)用户研究方法(访谈、调查、观察)原型设计与用户测试大学教授与研究人员HCI 研究员数据科学家与分析师
文献标题
LAPS: Automating Hypothesis-Driven Statistical Analysis of Public Survey Using Large Language Models
出版信息
- 主题领域: 社会科学研究中假设驱动的统计分析自动化框架。
- 关键词: 公共调查分析、大型语言模型、假设检验、统计规划、人机协作、认知负担、透明性、可重复性、社会科学、研究工作流。
背景与问题
- 问题/挑战: 公共调查数据的分析因结构不一致、变量集庞大以及研究者专业水平差异而复杂化。现有工具缺乏对假设驱动工作流的结构化支持,导致结果不稳定且可靠性降低。
- 重要性: 公共调查为政策和学术领域的关键决策提供信息,但其复杂性限制了数据的可访问性和可重复性,尤其对初学者而言。
- 动机与相关工作: 传统工具(如 SPSS、R)以及近期基于人工智能的系统提供了部分支持,但未能解决公共调查数据的特定挑战,例如复杂的调查设计和假设的操作化。通用大型语言模型(LLM)未能与领域特定工作流对齐,输出可能偏离研究者的意图。
解决方案
- 提出的方法: LAPS(LLM辅助的公共调查数据分析自动化框架),一个支持假设驱动统计分析的端到端系统。
- 创新点:
- 引入由四个模块组成的结构化流程:操作化、规划、执行和报告。
- 融入人机交互机制,在自动化与研究者自主性之间实现平衡。
- 提供自我优化循环,用于变量选择和分析计划的迭代改进。
- 系统行为与领域特定工作流对齐,确保透明性和可重复性。
- 流程与关键技术:
- 操作化: 解析调查代码表,验证假设,选择变量,并进行迭代优化。
- 规划: 将描述性统计与结构化分析计划关联,纳入复杂调查设计元素。
- 执行: 生成并调试用于调查加权分析的混合 Python–R 代码。
- 报告: 生成符合 APA 风格的统计报告,包含上下文解释和审计记录。
结果
- 具体发现:
- LAPS 的 SUS 评分显著高于基线工具(平均差异 = 42.30,p < 0.001)和通用大型语言模型(平均差异 = 12.90,p < 0.05)。
- NASA-TLX 评分显示,与基线工具相比,认知负担降低(平均差异 = 1.94,p < 0.001),与通用大型语言模型相比也有所降低(平均差异 = 0.86,p < 0.01)。
- TXAI 评分表明,与通用大型语言模型相比,研究者对 LAPS 解释的信任度更高(总体平均差异 = -0.87,p < 0.05)。
- 相较基线的优势:
- 通过统一工作流减少认知负担。
- 可用性和信任度评分高于传统工具和通用大型语言模型。
- 增强研究者自主性和分析稳定性。
- 实验/评估:
- 对 12 位社会科学研究者进行用户研究,分析欧洲社会调查数据集,比较三种环境:基线工具、通用大型语言模型和 LAPS。
- 测量指标包括 SUS、NASA-TLX、TXAI,以及半结构化访谈。
- 局限性与未来工作:
- 复杂调查代码表的处理时间较长。
- 混合 Python–R 架构增加了执行复杂性。
- 当前支持不包括高级方法,如结构方程模型(SEM)或多层次建模。未来工作将通过 OCR 集成、微调 LLM 和扩展分析能力来解决这些限制。
总结
LAPS 是一个利用大型语言模型支持公共调查数据假设驱动统计分析的自动化框架。它通过操作化、规划、执行和报告的结构化流程,保留研究者自主性,降低认知负担,并生成可信的结果。与社会科学研究者的实证评估表明,与传统工具和通用大型语言模型相比,LAPS 在可用性、信任度和分析稳定性方面有显著提升。未来改进将集中于减少处理时间、简化混合架构以及扩展对高级统计方法的支持。LAPS 为将大型语言模型整合到实证研究工作流中以及推进社会科学分析中的人机协作提供了实用指导。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 75%
InterFlow:设计无干扰人工智能以赋能半结构化访谈中的访谈者
CHI '26· 大语言模型(LLM)的人机协作 +3
- 67%
Perspectra:选择专家增强多智能体研究创意生成中的批判性思维
CHI '26· 大语言模型(LLM)的人机协作 +3
- 67%
Evalet: 通过功能碎片化评估大型语言模型
CHI '26· 大语言模型(LLM)的人机协作 +3
- 67%
设计LLM的分阶段评估工作流程:整合领域专家、普通用户和模型生成的评估标准
CHI '26· 大语言模型(LLM)的人机协作 +3
- 67%
PaperTrail:用于在基于LLM的学术问答中追溯 provenance 的声明-证据界面
CHI '26· 大语言模型(LLM)的人机协作 +3
- 67%
从劳作到思考:系统性文献综述中战略性探索与负责任 AI 的设计
IUI '26· 可解释人工智能(XAI) +3
- 67%
将互补特征集整合用于人类-AI决策
IUI '26· 大语言模型(LLM)的人机协作 +3
- 67%
Criticality:基于交互式批判性思维与循证推理痕迹的决策支持脚手架
IUI '26· 大语言模型(LLM)的人机协作 +3
- 63%
基于大语言模型的临界论文阅读现场思考交流
IUI '26· 大语言模型(LLM)的人机协作 +2
- 63%
DiscipLink:通过人机协同探索促进跨学科信息寻求过程
UIST '24· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791665
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、可解释人工智能(XAI)、用户研究方法(访谈、调查、观察)
work
职业/产业
大学教授与研究人员、HCI 研究员、数据科学家与分析师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文