使用Teleoscope凝聚图式:Reddit大型文本语料库的主题策划
作者
用户研究方法(访谈、调查、观察)原型设计与用户测试探索式搜索与信息探寻HCI 研究员数据科学家与分析师
文献标题
Crystallizing Schemas with Teleoscope: Thematic Curation of Large Text Corpora on Reddit
出版信息
- 主题领域: 大规模文本语料库的定性数据整理与分析。
- 关键词: 主题整理、定性研究、大规模文本语料库、解释学方法、NLP、语义搜索、数据可视化、Reddit、主题模式、协作研究。
背景与问题
- 问题/挑战: 像Reddit这样的大规模文本语料库由于其规模庞大,对定性研究者来说难以处理。现有的统计抽样方法在数据整理上与解释学定性研究范式不一致。
- 意义: 解决这一问题可以使研究者在处理大数据集时保持方法论的一致性,从而更深入、更细致地洞察社会和文化现象。
- 动机与相关工作: 现有系统主要关注语料库层面的统计总结或基于主题的概览,缺乏对迭代式、解释学整理的支持。本文基于人工智能和NLP的最新进展,提出了一种与定性研究原则相一致的数据整理系统。
解决方案
- 提出的方法: Teleoscope,一个基于网络的主题整理界面,支持对大规模文本语料库进行迭代、交互和反思性的主题模式精炼。
- 创新点:
- 引入了主题整理,一种解释学抽样策略,生成主题模式。
- 开发了一个开源的协作数据整理平台。
- 通过多阶段部署对系统进行了实证评估,涉及定性研究者的实际应用。
- 流程与关键技术:
- 用户通过关键词搜索过滤语料库。
- 文档通过NLP驱动的操作(如基于向量相似度的排序、聚类)进行分组、注释和迭代精炼。
- 输出包括主题模式和可视化工件,反映研究者对文档关系的心理模型。
- 协作功能支持研究者共享、检查和修改工作流程。
结果
- 具体发现:
- Teleoscope 支持新关键词和术语的意外发现。
- 研究者报告称在达到搜索饱和度方面信心增强,解释偏差减少。
- 主题模式促进了细致的讨论和协作探索。
- 相较基线的优势:
- 支持解释学的文档级探索,而非语料库级统计概览。
- 提供与定性研究范式一致的迭代式、人机协作工作流程。
- 实验/评估:
- 进行了三次部署:一次与计算机科学家的形成性研究,一次与定性研究者(n=5)的扩展形成性研究,以及一次与护理研究团队的实地部署。
- 评估结果显示了系统的可用性、方法论一致性以及对协作工作流程的支持。
- 公共发布包括在市场研究和公共政策中的应用案例。
- 局限性与未来工作:
- 对不熟悉计算工具的定性研究者来说学习曲线较陡。
- 对通用LLM的使用有限;未来工作可探索其集成。
- 当前聚焦于Reddit数据;未来版本将支持更广泛的数据来源。
总结
Teleoscope 是一个基于网络的系统,旨在支持对大规模文本语料库的解释学整理方法,弥合统计抽样与定性研究原则之间的方法论差距。通过支持迭代和交互式工作流程,它使研究者能够创建反映文档关系心理模型的主题模式。实证评估表明,该系统在促进意外发现、实现搜索饱和以及支持协作探索方面具有显著效果。尽管仍存在学习曲线陡峭等挑战,Teleoscope 显示出作为跨领域定性研究可扩展工具的潜力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791310
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
用户研究方法(访谈、调查、观察)、原型设计与用户测试、探索式搜索与信息探寻
work
职业/产业
HCI 研究员、数据科学家与分析师
article
内容状态
已索引正文
hub
相关论文
3 篇相关论文