什么时候机器学习数据是好的?:公共卫生数据化评估
作者
遥操作驾驶(Teleoperation)AI 辅助决策与自动化系统AI 伦理、公平与问责社区健康工作者AI/ML 研究员与工程师
文献标题
When is Machine Learning Data Good?: Valuing in Public Health Datafication
文献信息
- 主题领域: 人机交互 (HCI)、机器学习、公共卫生数据处理
- 关键词: 数据工作、印度、公共卫生、数据价值、机器学习数据、伦理、数据质量、数据供应链、数据上下文、透明性与问责性
研究背景与问题
-
发现的问题或挑战:
- 机器学习模型的质量依赖于数据质量。然而,公共卫生数据在采集、处理和应用的多个阶段中存在“数据噪声”、不完整、重复和不可靠标签等问题。
- 数据从采集到使用过程中的透明性和问责不足,导致冲突和多方视角的差异。
- 数据质量问题嵌入于采集方(例如基层卫生工作者)的社会、文化、地理等复杂背景,而开发者往往缺乏足够的上下文信息进行模型优化。
-
研究的重要性:
- 机器学习的快速发展越发依赖于大量高质量的数据集,而理解数据质量如何伴随不同阶段的工作演变对于提升模型质量至关重要,尤其在公共卫生等高风险领域。
- 数据供应链中的价值冲突可能会抑制数据驱动技术的潜力,特别是在全球南方地区(比如印度)的数据工作生态中。
-
研究动机与相关工作:
- 扩展了关于数据质量、全球健康和数据工作的现有研究,特别是对于数据供应链如何变化以及不同阶段中数据如何被赋予价值的理解。
- 结合了学术话题如“数据价值”、“数据伦理”以及“透明性与问责”的框架,探讨公共卫生数据如何在机器学习建模中转化。
解决方案
-
方法或解决方案:
- 作者基于对印度公共卫生系统中数据供应链涉及的46名参与者的访谈研究,分析了数据从采集到开发机器学习模型的过程中如何变化。
- 通过价值研究的视角,引入供应链的“价值赋予”概念,分析数据采集者(即基层卫生工作者)、数据管理员和机器学习开发者如何对数据赋予“好”与“有用”的定义。
-
创新之处:
- 提出了以数据供应链为框架的价值赋予分析工具,探索每个阶段如何“改造”数据以使其适用于特定用途。
- 识别数据供应链中透明性和问责的关键问题,建议如何在组织层面改善数据工作。
-
实施步骤与关键技术:
- 数据收集:访谈方法,包括与卫生工作者、数据管理员及机器学习开发者进行半结构化访谈。
- 数据分析:使用定性分析方法识别跨角色的共同主题,形成数据流动过程的价值张力模型。
- 案例研究:深入研究印度公共卫生的动态数据环境,包括地区语言、人文背景、隐私保护等因素。
研究成果
-
具体成果:
-
通过不同角色间的数据工作分析,作者发现了以下张力:
- 数据质量:开发者关注结构化、规范化的高质量数据,而采集者受到社会、人文及地理限制,数据可能缺失或有偏差。
- 数据上下文:开发者缺乏足够的信息来理解数据的采集背景,而采集者对数据最终用途缺乏认知。
- 组织激励:采集者的工作更多受到财政激励和表现评估的驱动,与开发者的技术和科研诉求存在差异。
-
总结了不同角色对“良好”数据的价值赋予:
- 数据采集者:完成工作并满足行政需求的数据。
- 数据管理员:能支持信息化管理系统完整性与同步性的光滑数据。
- 数据开发者:适合模型训练且能实现高预测性能的数据。
-
-
与现有解决方案相比优势:
- 将数据供应链视角与机器学习系统的设计相结合,使数据工作可视化,更符合真实世界动态环境中的优化需求。
- 强调社会、文化和组织结构对数据质量影响的关注,拓宽了技术解决方案的应用范围。
-
实验或评估结果:
- 数据采集的过程中存在安全风险、社区信任建设的不确定性及不同语言环境带来的挑战。
- 数据管理员和开发者在数据处理和模型生成中耗费了大量的额外工作去弥补数据缺陷,进一步凸显数据采集阶段的基础性。
- 通过访谈识别的数据供应链透明性问题,反映了数据工作中不同角色的欠沟通。
-
局限性与未来方向:
-
局限性:
- 数据工作生态复杂且具有区域性特征,研究结果可能难以适用于其他国家或领域。
- 开发者的报告样本数量较小且局限于少数合作组织。
-
未来方向:
- 建议进一步推进数据供应链透明性研究,开发工具使每个阶段的工作保持可视且可问责。
- 探索如何提升数据采集者的数据素养与主体性,改善人工智能工具与基层工作的结合。
- 设计更为高效且公平的组织激励方案,将卫生工作者的工作动机与最终的科学目的结合起来。
-
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 什么是高质量的机器学习数据,如何通过数据供应链解析其价值?分类: 机器学习模型可视分析同类问题arrow_forward
- 公共卫生领域的数据如何从采集到应用过程中发生转化,并影响模型的质量?分类: 机器学习模型可视分析同类问题arrow_forward
- 如何解决数据供应链中的透明性和责任归属问题,以改善数据质量?分类: 机器学习模型可视分析同类问题arrow_forward
lightbulb
现实痛点
1- 机器学习开发者缺乏公共卫生数据的采集背景,数据质量和信任问题突出分类: 机器学习模型可视分析同类问题arrow_forward
- 60%
值多少:人类为了不与AI系统进行谈判而覆盖了自己的经济自我利益
CHI '22· AI 辅助决策与自动化系统 +1
- 60%
通过贝叶斯逆强化学习自主评估示范充分性
HRI '24· 遥操作驾驶(Teleoperation) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3501868
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
遥操作驾驶(Teleoperation)、AI 辅助决策与自动化系统、AI 伦理、公平与问责
work
职业/产业
社区健康工作者、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文