模型定位与计算反思性:在数据科学中促进反思性

荣誉提名
可解释人工智能(XAI)AI 伦理、公平与问责隐私设计与用户控制AI/ML 研究员与工程师HCI 研究员统计学家与数据科学家

文献标题

Model Positionality and Computational Reflexivity: Promoting Reflexivity in Data Science

文献信息

  • 主题领域: 人类中心数据科学、机器学习伦理、注释数据处理
  • 关键词: 计算反思性, 模型定位性, 数据科学, 人类中心机器学习, 注释指纹, 位置挖掘, 持批评态度的数据研究, 在线社区
  • 作者和邮箱: Scott Allen Cambo (scottallencambo@gmail.com), Darren Gergle (dgergle@northwestern.edu)
  • 出版会议与时间: CHI Conference on Human Factors in Computing Systems (CHI ’22), April 29-May 5, 2022
  • DOI: https://doi.org/10.1145/3491102.3501998

研究背景与问题

  • 作者发现的问题或挑战:

    • 数据科学和机器学习方法虽然旨在客观分析,但其开发和部署过程中存在未被充分承认的主观决策,导致潜在偏见。
    • 社交平台上的模型,比如用于检测在线骚扰的算法,由于人类对概念(如“毒性”的定义)的主观理解差异,实际应用有限。
    • 大规模的机器学习工作流程未能充分透明地披露数据科学家、标注者和模型的社会文化背景。
  • 为什么这个问题很重要:

    • 数据科学被广泛应用于影响人类生活的重要领域(如刑事司法、疫苗分配),其潜在偏见和错误决策可能对社会公正有深远影响。
    • 缺乏对模型开发过程的深入反思,可能导致对少数群体的不公平对待甚至系统性压迫。
  • 研究动机与相关工作:

    • 延续人类中心数据科学的工作趋势,推动对决策过程透明化和反思性分析。
    • 借鉴社会科学的定性研究方法,如位置性和反思性,将其扩展到数据科学的背景下。

解决方案

  • 作者提出的解决方案:

    • 提出了两个核心概念:“模型定位性”和“计算反思性”。
    • 开发了新的技术:注释指纹和位置挖掘,以帮助理解模型与标注者及数据科学家的社会文化背景。
  • 解决方案的创新之处:

    • 模型定位性(Model Positionality):揭示模型的社会和文化位置,以及模型如何在复杂社会技术系统中作出决策。
    • 计算反思性(Computational Reflexivity):通过规模化的数据和算法方法促进反思性分析,与传统反思性方法互补。
    • 注释指纹(Annotator Fingerprinting):用数据结构展示注释者的行为模式,包括人工标注者和机器模型。
    • 位置挖掘(Position Mining):利用无监督聚类技术发现注释者的观点群体,阐释数据中的预测性偏差。
  • 实施步骤与关键技术:

    • 使用主题建模方法(例如LDA),对标注数据进行分解以解决标注稀疏问题。
    • 利用注释指纹描述标注者以及机器学习模型行为模式。
    • 应用位置挖掘技术(如基于密度的聚类算法DBSCAN),识别数据中的主流或边缘标注观点。

研究成果

  • 具体研究成果:

    • 通过对Wikipedia Toxic Comments数据集的案例研究,验证了计算反思性和注释指纹的能力。
    • 在标注数据中发现了两个主要群体(Cluster 0和Cluster 1),代表了不同对“毒性”的理解。
    • 通过注释指纹和位置挖掘工具,将作者自己的位置与其他标注者及模型定位进行比较和可视化。
  • 与现有解决方案的比较与优势:

    • 提供更高保真度的分析工具,直接解决了传统方法中对标注者多样性不足的潜在问题。
    • 推动数据科学家反思个人价值观对模型开发过程的影响,同时提出更透明的统计和操作分析方法。
  • 实验或评估结果:

    • 借助Empath工具,对文本中显著词汇类别的分布差异进行了量化,揭示了标注者之间的重要分歧。
    • 数据科学家通过自身标注任务以及模型位置分析有助于更深层次地理解模型在社会技术环境中的影响。
  • 局限性与未来方向:

    • 注释指纹技术虽然解决了标注稀疏问题,但仍需防范用于掩盖研究数据或方法内在偏差的风险。
    • 限制因素包括复杂度增加可能导致滥用、技术门槛高,以及对模型行为的片面解释。
    • 未来工作可探索如何更好地整合计算反思性技术及语言数据分析工具,为数据科学的教育和方法论提供指导。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/68940/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3501998
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
荣誉提名
group
作者
2 位作者
sell
研究子方向
可解释人工智能(XAI)、AI 伦理、公平与问责、隐私设计与用户控制
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、统计学家与数据科学家
article
内容状态
已索引正文
hub
相关论文
6 篇相关论文