调试缺陷可视化:实证洞察助力人机协同调试系统设计
交互式数据可视化大语言模型(LLM)的人机协作AI 辅助决策与自动化系统数据科学家与分析师AI/ML 研究员与工程师HCI 研究员
文献标题
Debugging Defective Visualizations: Empirical Insights Informing a Human-AI Co‑Debugging System
出版信息
- 主题领域: 基于人机协作的可视化调试。
- 关键词: 可视化调试, Vega-Lite, 人机协作, 大型语言模型, Stack Overflow, 混合主动系统, 代码生成, 实证研究, 检索增强, 混合反馈。
背景与问题
- 问题/挑战: 可视化调试的复杂性源于其对人类视觉感知的依赖,用户通常难以独立解决问题。现有解决方案(如问答论坛和大型语言模型)在准确性、速度和用户意图的匹配上存在局限性。
- 重要性: 有效的调试对于创建准确且美观的可视化至关重要,而这些可视化对于数据交流和决策制定尤为关键。
- 动机与相关工作: 先前的研究探讨了程序员的求助行为、可视化创作和调试工具。然而,对于人类与人工智能调试方法的优劣势尚缺乏深入理解,也没有系统化框架来有效结合这些方法。
解决方案
- 提出的方法: 一个混合主动的人机协作调试系统,结合多模态澄清、检索增强、代码预览和混合反馈,以应对可视化调试的挑战。
- 创新点:
- 精心整理了来自 Stack Overflow 的 297 个 Vega-Lite 调试案例数据集。
- 进行了实证研究,比较了人类与人工智能调试方法,揭示了各自的优势和局限性。
- 设计并实现了一个结合人类解释能力与人工智能生成能力的混合主动系统。
- 通过用户研究评估了该系统,显著提高了调试的准确性和效率。
- 流程与关键技术:
- 数据集整理: 收集并验证了来自 Stack Overflow 的 297 个 Vega-Lite 调试案例。
- 实证研究: 分析了调试问题、人类响应以及人工智能在 297 个案例中的表现。
- 系统设计: 开发了多模态澄清、检索增强、代码预览和混合反馈模块。
- 评估: 使用 36 个未解决的调试案例,邀请 12 名参与者进行用户研究,与 LLM 和论坛基线进行比较。
结果
- 具体发现:
- 混合系统解决了 86% 的案例,优于论坛答案(42%)和 LLM 基线(42%)。
- 系统的一次交互准确率为 61%,而 LLM 基线为 28%。
- 参与者使用系统所需的交互轮次更少(1.53 轮),相比之下 LLM 基线为 2.33 轮。
- 相较基线的优势:
- 系统结合了人类响应的准确性与人工智能的速度,实现了更高的解决率和效率。
- 检索增强和混合反馈显著提高了调试准确性和用户满意度。
- 实验/评估:
- 数据集: 来自 Stack Overflow 的 36 个未解决的 Vega-Lite 调试案例。
- 评估指标: 准确性(首次交互和最终结果)、交互效率(解决问题所需轮次)以及用户满意度(Likert 量表评分)。
- 参与者: 12 名具有不同调试经验的用户。
- 局限性与未来工作:
- 数据集范围仅限于 Vega-Lite,研究结果可能无法推广到其他生态系统。
- 参与者多为计算机科学背景,缺乏多样性。
- 未来工作包括将系统扩展到其他可视化语法、提升数据集多样性,以及将框架集成到社区平台中。
总结
本文提出了一种用于可视化调试的混合主动人机协作系统,解决了单一人类或人工智能方法的局限性。通过结合多模态澄清、检索增强、代码预览和混合反馈,该系统在调试案例中实现了 86% 的准确率,显著优于论坛和 LLM 基线。用户研究表明,该系统在提高准确性、效率和用户满意度方面表现出色。这些发现突出了人类与人工智能在可视化调试中的互补作用,并为未来的协作调试平台奠定了基础。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 83%
EvalAssist:任务特定评估与 AI 辅助判断策略偏好的见解
UIST '25· 大语言模型(LLM)的人机协作 +1
- 75%
交互式推理:可视化和控制大语言模型中的思维链推理
IUI '26· 大语言模型(LLM)的人机协作 +3
- 71%
色域:一项设计探针以理解数据科学家如何理解机器学习模型
CHI '19· 可解释人工智能(XAI) +2
- 71%
Dango:使用大型语言模型的混合发起数据整理系统
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
在文档 haystack 中寻找针头:增强意外索赔检索工作流程
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
并非越多越好:在多AI建议中平衡决策准确性与从众压力
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
说服的机器人:研究对话式智能体的人格化语言表达如何影响用户感知与决策
CHI '26· 会话代理的人格与拟人化 +2
- 71%
多任务人机交互中的信念更新与委托:以受控模拟为证据
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
多智能体议价中人与人工智能的战略权衡
IUI '26· 大语言模型(LLM)的人机协作 +2
- 71%
使智能摘要界面中的缺失可见
IUI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791441
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
交互式数据可视化、大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
数据科学家与分析师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文