Diff in the Loop: Supporting Data Comparison in Exploratory Data Analysis

Interactive Data VisualizationVisualization Perception & CognitionComputational Methods in HCISoftware Engineers & DevelopersData Scientists & AnalystsStatisticians & Data Scientists

Title of the Paper

Diff in the Loop: Supporting Data Comparison in Exploratory Data Analysis

Paper Information

  • Domain: Data Science Tools and Visualization Techniques
  • Keywords: Data Science Programming, Exploratory Data Analysis, Data Comparison, Visualization Systems, Data Iteration, Data Difference Tracking, User Studies, Data Science Collaboration, Programming Tool Design, Data Workflow

Research Background and Problem

  • Identified Issues or Challenges: Data science heavily relies on iteration and collaboration, yet existing tools primarily focus on code differences and fail to effectively support tracking and understanding changes in data. For instance, modifications in code can have profound impacts on the overall data, but additional custom code is often required to inspect or visualize these changes.
  • Significance: Understanding data changes is central to exploratory data analysis. Visualizing data differences can enhance the efficiency of data science workflows, helping data scientists quickly identify unintended impacts and adjust their analytical paths.
  • Research Motivation and Related Work:
    • Existing tools like Jupyter Notebook and Verdant primarily focus on code version tracking but lack support for data iteration.
    • Previous work in the data analysis domain has explored visualizing data iteration, but these efforts typically focus on post-analysis rather than providing real-time support during iterative work.

Solution

  • Proposed Method or Solution: Introduced a concept called "Diff in the Loop (DITL)," which integrates data difference visualization as a core feature of exploratory data analysis tools.
  • Innovations:
    • Generates data version snapshots during real-time data analysis.
    • Provides three types of data difference visualizations: Parallel View, Opacity View, and Delta View, aiding users in understanding data changes.
    • Integrated into a simplified programming environment, embedding data difference tracking directly into the workflow.
  • Implementation Steps and Key Techniques:
    • Designed a simplified programming environment supporting code editing and execution while automatically saving data version snapshots.
    • Developed three visual analysis methods for displaying differences, implemented using the Vega-Lite graphics library for interactive visualization.
    • Offered interactive comparison designs, including bar chart comparisons, opacity slider adjustments, and difference value prompts.

Research Outcomes

  • Specific Results:
    • DITL was proven effective in experiments, helping data scientists understand the impact of code on data and enhancing their sensitivity to data iteration.
    • User studies demonstrated that DITL reduces the burden of writing verification and debugging code while providing greater insights.
  • Advantages:
    • Reduces the tedious process of writing validation code for data scientists.
    • Intuitive visualization tools reveal inter-column data impacts, facilitating more efficient problem discovery.
    • Particularly user-friendly for beginners and non-technical users, improving communication efficiency in collaborative work.
  • Experimental or Evaluation Results:
    • User studies involved 16 professional data scientists, with over 90% agreeing that DITL was helpful for their tasks. The number of code lines required to complete tasks was significantly reduced when using DITL.
    • Experiments showed that DITL not only simplifies comparisons but also accelerates the speed and accuracy of uncovering data insights.
  • Limitations and Future Directions:
    • Limitations:
      • DITL currently supports only simple structural changes in data tables and cannot handle more complex transformations like data pivoting.
      • The current version is limited to comparing two data tables, and extending it to multi-table comparisons requires further exploration.
      • Evaluations were based on predefined tasks rather than real-world user scenarios.
    • Future Directions:
      • Expand DITL to support more complex data pattern changes and comparisons across multiple charts.
      • Integrate DITL into existing mainstream data science tools such as Jupyter Notebook, PyCharm, and VS Code.
      • Explore applications in real-time programming environments to further optimize interaction and collaboration in data analysis.
      • Conduct long-term deployment experiments to validate its effectiveness in practical work scenarios.

Quick Actions

Share

Share this page

ios_share

https://hci.top/en/papers/chi/68891/2022

AdRecommended

Learn AI Coding at CodeNow

open_in_newOpen DOI Link
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3502123
At a Glance

Paper Snapshot

fact_check
dataset
Source
CHI
calendar_month
Year
2022
emoji_events
Award
No award tagged
group
Authors
4 authors
sell
Subtopics
Interactive Data Visualization, Visualization Perception & Cognition, Computational Methods in HCI
work
Professions
Software Engineers & Developers, Data Scientists & Analysts, Statisticians & Data Scientists
article
Content Status
Full text indexed
hub
Related Papers
10 related papers