使用Teleoscope凝聚图式:Reddit大型文本语料库的主题策划

用户研究方法(访谈、调查、观察)原型设计与用户测试探索式搜索与信息探寻HCI 研究员数据科学家与分析师

文献标题

Crystallizing Schemas with Teleoscope: Thematic Curation of Large Text Corpora on Reddit

出版信息

  • 主题领域: 大规模文本语料库的定性数据整理与分析。
  • 关键词: 主题整理、定性研究、大规模文本语料库、解释学方法、NLP、语义搜索、数据可视化、Reddit、主题模式、协作研究。

背景与问题

  • 问题/挑战: 像Reddit这样的大规模文本语料库由于其规模庞大,对定性研究者来说难以处理。现有的统计抽样方法在数据整理上与解释学定性研究范式不一致。
  • 意义: 解决这一问题可以使研究者在处理大数据集时保持方法论的一致性,从而更深入、更细致地洞察社会和文化现象。
  • 动机与相关工作: 现有系统主要关注语料库层面的统计总结或基于主题的概览,缺乏对迭代式、解释学整理的支持。本文基于人工智能和NLP的最新进展,提出了一种与定性研究原则相一致的数据整理系统。

解决方案

  • 提出的方法: Teleoscope,一个基于网络的主题整理界面,支持对大规模文本语料库进行迭代、交互和反思性的主题模式精炼。
  • 创新点:
    1. 引入了主题整理,一种解释学抽样策略,生成主题模式
    2. 开发了一个开源的协作数据整理平台。
    3. 通过多阶段部署对系统进行了实证评估,涉及定性研究者的实际应用。
  • 流程与关键技术:
    • 用户通过关键词搜索过滤语料库。
    • 文档通过NLP驱动的操作(如基于向量相似度的排序、聚类)进行分组、注释和迭代精炼。
    • 输出包括主题模式和可视化工件,反映研究者对文档关系的心理模型。
    • 协作功能支持研究者共享、检查和修改工作流程。

结果

  • 具体发现:
    • Teleoscope 支持新关键词和术语的意外发现。
    • 研究者报告称在达到搜索饱和度方面信心增强,解释偏差减少。
    • 主题模式促进了细致的讨论和协作探索。
  • 相较基线的优势:
    • 支持解释学的文档级探索,而非语料库级统计概览。
    • 提供与定性研究范式一致的迭代式、人机协作工作流程。
  • 实验/评估:
    • 进行了三次部署:一次与计算机科学家的形成性研究,一次与定性研究者(n=5)的扩展形成性研究,以及一次与护理研究团队的实地部署。
    • 评估结果显示了系统的可用性、方法论一致性以及对协作工作流程的支持。
    • 公共发布包括在市场研究和公共政策中的应用案例。
  • 局限性与未来工作:
    • 对不熟悉计算工具的定性研究者来说学习曲线较陡。
    • 对通用LLM的使用有限;未来工作可探索其集成。
    • 当前聚焦于Reddit数据;未来版本将支持更广泛的数据来源。

总结

Teleoscope 是一个基于网络的系统,旨在支持对大规模文本语料库的解释学整理方法,弥合统计抽样与定性研究原则之间的方法论差距。通过支持迭代和交互式工作流程,它使研究者能够创建反映文档关系心理模型的主题模式。实证评估表明,该系统在促进意外发现、实现搜索饱和以及支持协作探索方面具有显著效果。尽管仍存在学习曲线陡峭等挑战,Teleoscope 显示出作为跨领域定性研究可扩展工具的潜力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222971/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791310
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
用户研究方法(访谈、调查、观察)、原型设计与用户测试、探索式搜索与信息探寻
work
职业/产业
HCI 研究员、数据科学家与分析师
article
内容状态
已索引正文
hub
相关论文
3 篇相关论文