模型定位与计算反思性:在数据科学中促进反思性
荣誉提名可解释人工智能(XAI)AI 伦理、公平与问责隐私设计与用户控制AI/ML 研究员与工程师HCI 研究员统计学家与数据科学家
文献标题
Model Positionality and Computational Reflexivity: Promoting Reflexivity in Data Science
文献信息
- 主题领域: 人类中心数据科学、机器学习伦理、注释数据处理
- 关键词: 计算反思性, 模型定位性, 数据科学, 人类中心机器学习, 注释指纹, 位置挖掘, 持批评态度的数据研究, 在线社区
- 作者和邮箱: Scott Allen Cambo (scottallencambo@gmail.com), Darren Gergle (dgergle@northwestern.edu)
- 出版会议与时间: CHI Conference on Human Factors in Computing Systems (CHI ’22), April 29-May 5, 2022
- DOI: https://doi.org/10.1145/3491102.3501998
研究背景与问题
-
作者发现的问题或挑战:
- 数据科学和机器学习方法虽然旨在客观分析,但其开发和部署过程中存在未被充分承认的主观决策,导致潜在偏见。
- 社交平台上的模型,比如用于检测在线骚扰的算法,由于人类对概念(如“毒性”的定义)的主观理解差异,实际应用有限。
- 大规模的机器学习工作流程未能充分透明地披露数据科学家、标注者和模型的社会文化背景。
-
为什么这个问题很重要:
- 数据科学被广泛应用于影响人类生活的重要领域(如刑事司法、疫苗分配),其潜在偏见和错误决策可能对社会公正有深远影响。
- 缺乏对模型开发过程的深入反思,可能导致对少数群体的不公平对待甚至系统性压迫。
-
研究动机与相关工作:
- 延续人类中心数据科学的工作趋势,推动对决策过程透明化和反思性分析。
- 借鉴社会科学的定性研究方法,如位置性和反思性,将其扩展到数据科学的背景下。
解决方案
-
作者提出的解决方案:
- 提出了两个核心概念:“模型定位性”和“计算反思性”。
- 开发了新的技术:注释指纹和位置挖掘,以帮助理解模型与标注者及数据科学家的社会文化背景。
-
解决方案的创新之处:
- 模型定位性(Model Positionality):揭示模型的社会和文化位置,以及模型如何在复杂社会技术系统中作出决策。
- 计算反思性(Computational Reflexivity):通过规模化的数据和算法方法促进反思性分析,与传统反思性方法互补。
- 注释指纹(Annotator Fingerprinting):用数据结构展示注释者的行为模式,包括人工标注者和机器模型。
- 位置挖掘(Position Mining):利用无监督聚类技术发现注释者的观点群体,阐释数据中的预测性偏差。
-
实施步骤与关键技术:
- 使用主题建模方法(例如LDA),对标注数据进行分解以解决标注稀疏问题。
- 利用注释指纹描述标注者以及机器学习模型行为模式。
- 应用位置挖掘技术(如基于密度的聚类算法DBSCAN),识别数据中的主流或边缘标注观点。
研究成果
-
具体研究成果:
- 通过对Wikipedia Toxic Comments数据集的案例研究,验证了计算反思性和注释指纹的能力。
- 在标注数据中发现了两个主要群体(Cluster 0和Cluster 1),代表了不同对“毒性”的理解。
- 通过注释指纹和位置挖掘工具,将作者自己的位置与其他标注者及模型定位进行比较和可视化。
-
与现有解决方案的比较与优势:
- 提供更高保真度的分析工具,直接解决了传统方法中对标注者多样性不足的潜在问题。
- 推动数据科学家反思个人价值观对模型开发过程的影响,同时提出更透明的统计和操作分析方法。
-
实验或评估结果:
- 借助Empath工具,对文本中显著词汇类别的分布差异进行了量化,揭示了标注者之间的重要分歧。
- 数据科学家通过自身标注任务以及模型位置分析有助于更深层次地理解模型在社会技术环境中的影响。
-
局限性与未来方向:
- 注释指纹技术虽然解决了标注稀疏问题,但仍需防范用于掩盖研究数据或方法内在偏差的风险。
- 限制因素包括复杂度增加可能导致滥用、技术门槛高,以及对模型行为的片面解释。
- 未来工作可探索如何更好地整合计算反思性技术及语言数据分析工具,为数据科学的教育和方法论提供指导。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何通过'模型定位'揭示数据模型的社会和文化背景?分类: 机器学习公平性与数据开发实践同类问题arrow_forward
- ‘计算反思性’如何支持数据科学中反思性分析的实现?分类: 机器学习公平性与数据开发实践同类问题arrow_forward
- 如何使用'注释者指纹'和'立场挖掘'技术分析模型和注释者的偏见?分类: 机器学习公平性与数据开发实践同类问题arrow_forward
lightbulb
现实痛点
1- 数据科学模型开发中的主观决策易引入偏见,影响公平决策。分类: 机器学习公平性与数据开发实践同类问题arrow_forward
- 71%
解构自主性:基于自由框架解释AI技术接受度
CHI '26· 可解释人工智能(XAI) +2
- 71%
认证AI系统等同于可信?探索专家和普通用户对AI认证的认知与需求
CHI '26· 可解释人工智能(XAI) +2
- 67%
不要只是告诉我,问我:将解释作为问题来智能构建的AI系统可以提高人类逻辑辨别准确性,超过因果AI解释
CHI '23· 可解释人工智能(XAI) +1
- 63%
PASTA:一个可扩展的多策略AI合规评估框架
CHI '26· 可解释人工智能(XAI) +3
- 63%
跨LLM聊天机器人用户报告风险的表征分析
CHI '26· 大语言模型(LLM)的人机协作 +3
- 63%
AI与我的价值观:用户对LLM从休闲对话中提取、体现和解释人类价值观能力的看法
CHI '26· 大语言模型(LLM)的人机协作 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3501998
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
荣誉提名
group
作者
2 位作者
sell
研究子方向
可解释人工智能(XAI)、AI 伦理、公平与问责、隐私设计与用户控制
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、统计学家与数据科学家
article
内容状态
已索引正文
hub
相关论文
6 篇相关论文