Dango:使用大型语言模型的混合发起数据整理系统
研究背景与问题
-
问题或挑战: 研究指出,数据整理(Data Wrangling)是数据科学流程中耗时、复杂且容易出错的环节,占数据科学家工作时间的80%。现有工具主要面临以下限制:
- 局限于单表操作,无法解决多表任务。
- 仅支持用户演示指定转换意图,难以处理复杂逻辑或条件操作。
- 自然语言描述(NL)虽然简洁,但容易引发误解或生成错误操作。 此外,基于大型语言模型(LLM)的自动化工具容易误解用户意图,不提供有效机制修正或澄清其错误,也会生成使用户难以理解或验证的代码。
-
重要性: 数据整理是数据科学不可或缺的环节,改善工具的效率和精确性对于提高实际工作效率和减少用户负担至关重要。多表数据操作的广泛需求进一步凸显了工具改进的必要性。
-
研究动机与相关工作: 作者复盘了多种交互式工具与编程演示方法(如PBD),并发现这些方法在帮助数据科学家提高效率方面具有显著作用,同时,通过利用LLM的自然语言理解能力,可以弥补现有工具中意图表达模糊的问题。然而,目前缺乏混合式交互设计来解决意图澄清、复杂多表操作以及结果验证等问题。
解决方案
-
方法或解决方案: 作者提出了具有混合交互特征的工具——Dango,旨在通过结合多种交互设计优化数据整理任务,核心功能包括:
- 集成演示及自然语言输入,支持丰富的意图表达。
- 使用LLM主动生成澄清问题(Clarification Questions, CQ),帮助用户明确意图。
- 提供逐步自然语言解释(Step-by-Step NL Explanation)以辅助用户理解脚本行为,并支持直接编辑以修改脚本内容。
- 提供数据溯源视图(Data Provenance View),追踪表格版本的操作变更。
-
创新之处:
- 澄清问题生成:通过主动提问解析含混意图,而不仅依赖用户的描述,降低了错误率与意图误解。
- 逐步自然语言解释:避免LLM生成“幻觉式错误”文档,使脚本更易懂且支持用户精确定位问题。
- 混合交互设计:整合演示、自然语言输入和工具的交互反馈,使用户和系统合作完成复杂任务。
- 多表操作支持:扩展DSL语言语法,服务多表场景和统计测试等高级数据操作需求。
-
实施步骤与关键技术:
- 意图分析阶段:
- 捕捉用户演示历史。
- 使用LLM分析用户对多张表的输入,并生成澄清问题(CQ)或总结明确意图。
- DSL脚本生成:
- 由LLM基于用户意图分解任务,生成分步脚本计划。
- 检查生成的DSL语法并验证其正确性,避免幻觉式错误。
- 程序验证与优化:
- 翻译DSL脚本为结构化自然语言解释,辅助用户验证。
- 用户可通过编辑逐步解释或重新生成脚本进行优化。
- 提供数据溯源视图以可视化追踪修改。
- 意图分析阶段:
研究成果
-
具体成果: 作者通过实验及用户研究验证了Dango的高效性:
- 可帮助用户完成广泛多样的数据任务(例如多表合并、条件过滤、统计分析)。
- 帮助用户成功率、错误修正时间及生成脚本的信心指数显著提升。
-
与现有解决方案相比的优势: Dango相比传统工具与其他LLM系统展现出以下优越性:
- 用户完成任务成功率达100%(Condition C),而基准比较工具Condition A有失败案例。
- 平均任务完成时间减少45%(Condition C比Condition A),澄清问题有效减少LLM生成错误的频率。
- 特别是在任务复杂度较高时,多表操作与意图澄清功能展现了显著效能。
-
实验或评估结果:
- 用户测试:38名参与者在3种工具设计条件下完成7个数据整理任务,并给出基于NASA TLX的主观评价。
- 在最优设计条件(C)下,人均任务完成时间为3分30秒(比A条件缩短45%,比B缩短32%)。
- 条件C生成错误脚本(幻觉)率最低(0.18%);相比之下,Condition A为0.65。
- 广义化复杂任务测评:对24种任务进行扩展测试,所有任务均成功解决。
- 用户测试:38名参与者在3种工具设计条件下完成7个数据整理任务,并给出基于NASA TLX的主观评价。
-
局限性与未来方向:
- DSL功能限制:现有DSL语言不支持直接实现复杂控制流(如循环),可能无法完全覆盖更高复杂度的任务。
- 真实环境缺失:实验条件相对受控,没有模拟真实工作环境中的协作因素和数据规模。
- 用户准备度障碍:部分用户在表达复杂意图时仍面临困难,未来可进一步优化自然语言描述与交互设计。
- 跨模态交互扩展:未来可以集成图片标注或手势操作辅助复杂场景的数据处理。
通过整体评估,Dango在改善数据整理工具的有效性和用户体验方面具有显著贡献,且为未来的集成式人机交互设计铺平了道路。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 如何通过混合交互设计提升数据清洗工具的效率与准确性?分类: 科学异常检测与因果分析支持同类问题arrow_forward
- 混合交互设计是否能够有效支持用户的多表操作和复杂任务?分类: 科学异常检测与因果分析支持同类问题arrow_forward
- 生成澄清问题(CQ)和逐步自然语言解释能否降低用户错误和误解率?分类: 科学异常检测与因果分析支持同类问题arrow_forward
现实痛点
1- 数据科学家在处理复杂数据清洗任务时效率低且易出错。分类: 科学异常检测与因果分析支持同类问题arrow_forward
- 71%
Jupybara:利用LLM实现可用于操作的数据分析和叙事设计空间
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
ChainBuddy:一种用于生成LLM管道的人工智能辅助代理系统
CHI '25· 大语言模型(LLM)的人机协作 +1
- 71%
结果-可行动性差距:理解从业者如何在实际环境中评估 LLM 产品
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
DataSpeck:一种人工智能驱动的端到端人机协作系统,用于实现数据转换工作流的自动化
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
调试缺陷可视化:实证洞察助力人机协同调试系统设计
CHI '26· 交互式数据可视化 +2
- 71%
使多模态大语言模型成为可靠的图表数据提取器:基准测试与训练框架
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
PleaSQLarify:面向自然语言数据库查询的视觉语用修复
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
SCSimulator:一种基于大语言模型多智能体模拟的供应链合作伙伴选择探索性可视化分析框架
IUI '26· 大语言模型(LLM)的人机协作 +2
- 71%
基于交互式任务分解的AI辅助数据分析引导与验证改进
UIST '24· 大语言模型(LLM)的人机协作 +2
- 71%
RAGTrace:理解和改进检索增强生成中的检索-生成动态
UIST '25· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)