小、中、大?一项关于CHI效应量的元研究,以帮助解释效应量和功率计算

用户研究方法(访谈、调查、观察)计算方法在HCI中的应用研究伦理与开放科学HCI 研究员统计学家与数据科学家

研究背景与问题

  • 问题与挑战: 本研究发现统计报告,尤其是效果量在 CHI 的定量研究中表现出低频率的报告和讨论。这些问题对研究的实际意义评估、前瞻性功效分析以及领域内研究结果整合具有重要影响。此外,大多数解释仅限于域外无关结构,也缺乏专门的效果量判断指南。
  • 重要性: 效果量有助于研究的实际影响性评估,提供科学有效的样本规模计算指导。同时,缺乏领域特定的效果量标准增加了研究重复性、实验设计以及资源浪费的风险。
  • 研究动机与相关工作: 先前研究在诸多领域,例如心理学和医学中强调从统计报告中获取有意义信息的重要性。但在 HCI 特别是 CHI 社区中,效果量讨论存在显著缺失。本研究旨在解决这一问题,开发工具并构建 CHI 领域效果量分布,为 CHI 社区提供指导。

解决方案

  • 提出的解决方案:
    • 开发了一个基于大语言模型(GPT-4)的统计信息提取工具,以提取和分类 CHI 论文中的统计数据。
    • 完成对 2019-2023 年间 CHI 论文的全面量化分析,总结出 12 个研究领域的效果量分布。
    • 提出效果量的分析框架,并识别 CHI 研究中效果量解释的五种主要方法。
  • 创新点:
    • 开发了新型提取工具,以自动化分析数据,同时引入一致性检查以减少模型幻觉。
    • 基于提取的统计数据,构建了 CHI 社区内多个领域的专属效果量分布阈值,填补了领域特定指导的空缺。
    • 定性分析 CHI 论文的效果量解释方式,并提出效果量讨论的结构化框架。
  • 实施步骤与技术:
    • 检索和过滤定量 CHI 论文。
    • 通过 GPT-4 提取基本统计测试结果,包括 p 值、效果量、置信区间及样本数量。
    • 将不同类型的效果量统一转换为 Pearson's r 并使用尖分点划分效果量阈值。
    • 进行定性分析以总结报告的效果量解释方法与实践。

研究成果

  • 具体成果:
    • 从 1692 篇 CHI 定量论文中提取共超过 6000 个效果量,并建立跨 12 个研究领域的效果量阈值指南。
    • 提出效果量解释的五种分类方法:比较测试值(如描述方向)、分配大小标签、参考统计框架、比较不同观察结果以及“大图”解释。
  • 优势:
    • 提供 CHI 12 个领域特定的效果量参考,有助于研究者更好地理解结果和进行前瞻性功效分析。
    • 通过定量和定性分析结合,优化效果量讨论的方式,鼓励透明报告和实用性解读。
  • 实验或评估结果:
    • 通过对工具提取性能的测试,发现所有效果量均能正确提取,但部分效果量存在漏报问题(约 32%)。
    • 研究显示 CHI 整体效果量分布的显著差异,与研究领域相关的阈值变异也清晰呈现。
    • 对 67 篇 CHI'23 定量论文的分析表明效果量的报告用法仍需改进,特别是域指定解释。
  • 局限性与未来方向:
    • 提取工具存在一定的假阴性限制造成数据遗漏。
    • 转换效果量引入校正因子时可能出现误差,尤其是不同设计模式(组间与组内的效果比较)。
    • 建议未来进一步自动化报告生成,将统计测试信息嵌入补充材料,以扩展指南覆盖此外的效果指标。

总结

本研究通过实证分析和工具开发提出了面向 CHI 社区的效果量报告和解读框架,并为研究者的效果量评估与功效分析提供了丰富指导。未来可以继续扩展效果量规范的自动化工具,以及针对更广领域的实用方法。这为 CHI 定量研究质量提升和透明性推进提供了重要的推进力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188667/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713671
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
用户研究方法(访谈、调查、观察)、计算方法在HCI中的应用、研究伦理与开放科学
work
职业/产业
HCI 研究员、统计学家与数据科学家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文