揭示差距:基于多尺度密度差异图的大规模数据集可视化比较

交互式数据可视化可视化感知与认知数据科学家与分析师AI/ML 研究员与工程师HCI 研究员

文献标题

Revealing the Gap: Visual Comparison of Large-Scale Datasets via Multi-Scale Density Difference Map

出版信息

  • 主题领域: 面向机器学习应用的高维数据集可视化比较。
  • 关键词: 可视化比较,密度差异图,大规模数据集,机器学习,数据集可视化,多尺度分析,交互工具,合成数据,真实数据,分层网格。

背景与问题

  • 问题/挑战: 现有基于密度的可视化方法在平衡全局和局部比较方面存在困难,无法在拥挤区域中揭示少数数据集的分布,并且在处理大规模数据集时计算效率低下。
  • 重要性: 理解数据集分布差异对于分类和目标检测等机器学习任务至关重要,有助于确保样本选择的代表性并减轻合成数据使用中的偏差。
  • 动机与相关工作: 现有方法如FID、KL散度和核密度估计(KDE)能够量化差异,但无法直观地解释这些差异。基于散点图和密度的可视化方法在处理具有重叠分布的大规模数据集时存在局限性。

解决方案

  • 提出的方法: DiffGrid,一种用于可视化大规模数据集密度差异的网格化工具,具有规则化布局、高效计算和分层细节探索功能。
  • 创新点:
    1. 一种规则化的密度差异可视化方法,支持平衡的多层次分析。
    2. 一个集成分层网格和图像标签的交互工具,用于逐步细节探索。
    3. 通过优化的最小二乘密度差异(LSDD+)算法提升效率。
  • 流程与关键技术:
    • 规则化: 积分图变换均匀分布点,同时保留聚类密度。
    • LSDD+: 基于网格的核中心和GPU优化的L-BFGS求解器实现高效密度差异估计。
    • 多尺度探索: 分层网格在缩放过程中逐步细化细节,插入方块指示少数数据集的存在。
    • 图像标签放置: 通过二次分配问题优化标签位置,避免遮挡并增强可解释性。

结果

  • 具体发现:
    • LSDD+在合成数据集上比传统LSDD实现高达62.19倍的加速,可扩展到包含5,000,000个样本的数据集,并在1,000,000个样本时保持接近秒级的运行时间。
    • 随着数据集规模的增加,均方误差(MSE)降低,确保密度差异估计的准确性。
    • 用户研究表明,与基线相比,DiffGrid在全局(96.9% vs. 78.1%)和局部(90.6% vs. 25.0%)任务中的准确性均有显著提升,且任务完成时间相当。
  • 相较基线的优势:
    • 在识别全局和局部差异方面具有更高的准确性。
    • 在大规模数据集上的可扩展性和效率显著提升。
    • 用户体验评估中表现出更好的可用性和满意度。
  • 实验/评估:
    • 在合成数据集上定量比较LSDD+与LSDD。
    • 包含16名参与者的控制用户研究,评估任务准确性、响应时间和主观体验。
    • 案例研究分析核心集与完整数据集以及合成与真实世界信息图表的差异。
  • 局限性与未来工作:
    • 对多数据集比较的支持有限;未来工作可解决成对比较的认知负担。
    • 对合成数据的比较缺乏不确定性意识;建议未来探索集成方法。

总结

DiffGrid 提出了一种新颖的基于网格的可视化方法,用于比较大规模数据集,解决了现有基于密度技术的局限性。通过结合规则化布局、高效的LSDD+计算和分层探索,它能够准确识别全局和局部差异,同时扩展到数百万样本的规模。定量实验、用户研究和案例研究证明了其在样本选择和合成数据分析等任务中的有效性。未来工作旨在扩展其多数据集比较和不确定性可视化能力,增强其在多样化机器学习场景中的适用性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222763/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791171
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
交互式数据可视化、可视化感知与认知
work
职业/产业
数据科学家与分析师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文