通过数据工作的工件追踪和可视化人与ML/AI的协作过程
荣誉提名大语言模型(LLM)的人机协作交互式数据可视化软件工程师与开发者AI/ML 研究员与工程师
文献标题
Tracing and Visualizing Human-ML/AI Collaborative Processes through Artifacts of Data Work
文献信息
- 主题领域: 人机协同工作,特别是在数据科学工作流中自动化机器学习 (AutoML) 技术与人类协作的可追溯性与可视化。
- 关键词: AutoML, 人机协作, 数据可视化, 工件分类, 端到端数据科学。
研究背景与问题
-
发现的问题或挑战:
- 当前的 AutoML 系统主要关注模型选择和数据准备的自动化,但实际操作中仍需大量的人工协调和人机协作。
- 自动化过程的"黑箱化"常导致团队间的协作摩擦,难以界定“何人何时做了什么”。
- 现有 AutoML 工具较少关注人类元素,只有有限的功能能够追踪和审查人类参与的数据科学工作流。
-
研究重要性: 在数据工作中捕获并追踪人工和机器智能的协作变得越来越重要。通过提高透明度和可解释性,能够帮助技术和非技术用户更有效地理解数据流和决策过程。
-
研究动机与相关工作:
- 受流行的视觉分析方法和 AutoML 文献的启发,作者试图创建一个工具来弥补自动化与人工操作间的鸿沟。
- 作者参考了先前关于人类-机器协作、可追溯性、以及视觉辅助分析的研究,设计了一个通用的工件分类来描述数据操作中的各种工件(人工输入或机器生成的)。
解决方案
-
方法与解决方案:
- 开发 AutoML 工件分类法: 创造一个分类体系,用于归纳和描述 AutoML 和人类协作过程中的工件。工件不仅包括输入与输出,还包含自动化过程中的元数据和文档。
- 开发 AutoML Trace 可视化交互原型: 这是一个交互式可视化工具,展示在数据工作流中人机协作所生成的工件及其动态演变。
- 提出数据工作可追溯性的定义: 包括工件的来源(provenance),透明度,和上下文三个核心方面。
-
创新之处:
- 将工件分类法扩展至更广泛的端到端数据工作流程的语境,涵盖了准备、分析、部署和沟通各个阶段。
- 提供了一个可适配于多种系统的分类法,支持捕获、追踪和可视化自动化数据科学过程中的工件。
-
实施步骤及关键技术:
- 工件分类法开发:
- 通过迭代的方式,使用文献综述和理论建构结合,从400个数据工件中提炼出最终的52个。
- 分类法包括4个维度:来源、传递模式、格式和任务。
- AutoML Trace 的开发:
- 在一个企业团队的实际 AutoML 系统中,调用 API 捕获工件,记录时间戳和依赖关系,以完成工件的追踪和版本比较。
- 提供三种可视化视图(来源视图、依赖视图和版本历史视图)来探索工件的来源、依赖关系及演变。
- 工件分类法开发:
研究成果
-
具体成果:
- 提出了一个适用于捕获人机协作工件的AutoML 工件分类法,涵盖了52种分组工件,并进一步分解到数据准备、分析、部署和沟通四大阶段。
- 开发了 AutoML Trace 可视化原型,展示了数据工作中的人机协作及 AutoML 系统对人工干预的反馈。
- 通过与企业团队的协作场景,验证了工具的设计有效性,帮助团队更好地理解其 AutoML 系统的功能和改进方向。
-
与现有解决方案的比较优势:
- 考虑了 AutoML 系统中人为因素和社会技术关系,对现有工具忽略人类元素的问题进行了补充。
- 分类法和工具的通用性使其可以扩展到不同的 AutoML 系统,支持更多任务。
-
实验或评估结果:
- 在与企业团队的合作中,该工具和分类法为他们提供了新的视角,帮助他们分析系统中的人机交互及改进需求。例如,他们能够清晰看到哪些人工干预被系统接受或忽略。
-
局限性与未来方向:
- 局限性:
- 分类法开发和工具验证仅基于少数企业团队的上下文,通用性有待验证。
- 系统当前缺乏对多用户合作和复杂协作的优化支持。
- 未来方向:
- 扩展到多团队、跨系统的验证,进一步完善和细化分类法。
- 开发更复杂的交互式设计以支持人-人及人-机器的异步协作分析。
- 将可视化科研重点延伸至不同类型的 AutoML 系统和新兴 ML/AI 技术。
- 局限性:
通过提出一个全新的分类方法并将其实施为可视化工具,作者为 AutoML 和人类协作的研究提供了重要的理论框架和实践工具,可进一步在学术界和工业界发扬光大。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何通过分类捕获和描述AutoML系统中人机协作的数据工件?分类: 机器学习模型可视化、调试与可解释性支持同类问题arrow_forward
- 如何利用可视化工具跟踪和展示人机协作的工作流及其演变?分类: 机器学习模型可视化、调试与可解释性支持同类问题arrow_forward
- 什么定义可以全面反映数据工作的可追溯性,包括工件来源、透明度和上下文关系?分类: 机器学习模型可视化、调试与可解释性支持同类问题arrow_forward
lightbulb
现实痛点
1- 团队成员难以了解AutoML系统中“谁在何时做了什么”。分类: 机器学习模型可视化、调试与可解释性支持同类问题arrow_forward
- 100%
大规模可视化深度神经网络示例
CHI '21· 大语言模型(LLM)的人机协作 +1
- 80%
通过自动生成的图像画廊探索生成对抗网络(GANs)的方法
CHI '21· 生成式AI(文本、图像、音乐、视频) +2
- 67%
结晶体:降低开发者收集和组织决策信息的成本
CHI '22· 大语言模型(LLM)的人机协作 +2
- 67%
Jupybara:利用LLM实现可用于操作的数据分析和叙事设计空间
CHI '25· 大语言模型(LLM)的人机协作 +2
- 67%
Dango:使用大型语言模型的混合发起数据整理系统
CHI '25· 大语言模型(LLM)的人机协作 +2
- 67%
使多模态大语言模型成为可靠的图表数据提取器:基准测试与训练框架
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 67%
PleaSQLarify:面向自然语言数据库查询的视觉语用修复
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
CodeVoyager:将交互式视觉辅助与LLM集成用于代码理解
IUI '26· 大语言模型(LLM)的人机协作 +2
- 67%
SCSimulator:一种基于大语言模型多智能体模拟的供应链合作伙伴选择探索性可视化分析框架
IUI '26· 大语言模型(LLM)的人机协作 +2
- 67%
基于交互式任务分解的AI辅助数据分析引导与验证改进
UIST '24· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3580819
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
荣誉提名
group
作者
2 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、交互式数据可视化
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文