Diff in the Loop: Supporting Data Comparison in Exploratory Data Analysis
Authors
Interactive Data VisualizationVisualization Perception & CognitionComputational Methods in HCISoftware Engineers & DevelopersData Scientists & AnalystsStatisticians & Data Scientists
Title of the Paper
Diff in the Loop: Supporting Data Comparison in Exploratory Data Analysis
Paper Information
- Domain: Data Science Tools and Visualization Techniques
- Keywords: Data Science Programming, Exploratory Data Analysis, Data Comparison, Visualization Systems, Data Iteration, Data Difference Tracking, User Studies, Data Science Collaboration, Programming Tool Design, Data Workflow
Research Background and Problem
- Identified Issues or Challenges: Data science heavily relies on iteration and collaboration, yet existing tools primarily focus on code differences and fail to effectively support tracking and understanding changes in data. For instance, modifications in code can have profound impacts on the overall data, but additional custom code is often required to inspect or visualize these changes.
- Significance: Understanding data changes is central to exploratory data analysis. Visualizing data differences can enhance the efficiency of data science workflows, helping data scientists quickly identify unintended impacts and adjust their analytical paths.
- Research Motivation and Related Work:
- Existing tools like Jupyter Notebook and Verdant primarily focus on code version tracking but lack support for data iteration.
- Previous work in the data analysis domain has explored visualizing data iteration, but these efforts typically focus on post-analysis rather than providing real-time support during iterative work.
Solution
- Proposed Method or Solution: Introduced a concept called "Diff in the Loop (DITL)," which integrates data difference visualization as a core feature of exploratory data analysis tools.
- Innovations:
- Generates data version snapshots during real-time data analysis.
- Provides three types of data difference visualizations: Parallel View, Opacity View, and Delta View, aiding users in understanding data changes.
- Integrated into a simplified programming environment, embedding data difference tracking directly into the workflow.
- Implementation Steps and Key Techniques:
- Designed a simplified programming environment supporting code editing and execution while automatically saving data version snapshots.
- Developed three visual analysis methods for displaying differences, implemented using the Vega-Lite graphics library for interactive visualization.
- Offered interactive comparison designs, including bar chart comparisons, opacity slider adjustments, and difference value prompts.
Research Outcomes
- Specific Results:
- DITL was proven effective in experiments, helping data scientists understand the impact of code on data and enhancing their sensitivity to data iteration.
- User studies demonstrated that DITL reduces the burden of writing verification and debugging code while providing greater insights.
- Advantages:
- Reduces the tedious process of writing validation code for data scientists.
- Intuitive visualization tools reveal inter-column data impacts, facilitating more efficient problem discovery.
- Particularly user-friendly for beginners and non-technical users, improving communication efficiency in collaborative work.
- Experimental or Evaluation Results:
- User studies involved 16 professional data scientists, with over 90% agreeing that DITL was helpful for their tasks. The number of code lines required to complete tasks was significantly reduced when using DITL.
- Experiments showed that DITL not only simplifies comparisons but also accelerates the speed and accuracy of uncovering data insights.
- Limitations and Future Directions:
- Limitations:
- DITL currently supports only simple structural changes in data tables and cannot handle more complex transformations like data pivoting.
- The current version is limited to comparing two data tables, and extending it to multi-table comparisons requires further exploration.
- Evaluations were based on predefined tasks rather than real-world user scenarios.
- Future Directions:
- Expand DITL to support more complex data pattern changes and comparisons across multiple charts.
- Integrate DITL into existing mainstream data science tools such as Jupyter Notebook, PyCharm, and VS Code.
- Explore applications in real-time programming environments to further optimize interaction and collaboration in data analysis.
- Conduct long-term deployment experiments to validate its effectiveness in practical work scenarios.
- Limitations:
Research Questions / Practical Problems
Question signals indexed for this paper.
help
Research Questions
3- How can data changes from code adjustments be effectively tracked and visualized during data analysis?Category: Analysis Workflows and Information Extraction ToolsSimilar questionsarrow_forward
- In exploratory data analysis, which data change visualization approach best supports data scientists' decisions?Category: Analysis Workflows and Information Extraction ToolsSimilar questionsarrow_forward
- How can real-time data difference tracking be integrated into programming tools to improve data analysis efficiency?Category: Analysis Workflows and Information Extraction ToolsSimilar questionsarrow_forward
lightbulb
Practical Problems
1- Data scientists struggle to intuitively track how code modifications affect data.Category: Analysis Workflows and Information Extraction ToolsSimilar questionsarrow_forward
- 83%
SEAM-EZ: Simplifying Stateful Analytics through Visual Programming
CHI '24· Interactive Data Visualization +2
- 83%
Unravel: A Fluent Code Explorer for Data Wrangling
UIST '21· Interactive Data Visualization +1
- 71%
Comparing Apples and Oranges: Taxonomy and Design of Pairwise Comparisons within Tabular Data
CHI '19· Interactive Data Visualization +2
- 71%
Wrex: A Unified Programming-by-Example Interaction for Synthesizing Readable Code for Data Scientists
CHI '20· Interactive Data Visualization +2
- 71%
Flux Capacitors for JavaScript DeLoreans: Approximate Caching for Physics-based Data Interaction
IUI '19· Interactive Data Visualization +2
- 71%
HiLT: A Library for Generating Human-in-the-Loop Data Transformation GUIs
UIST '25· Interactive Data Visualization +1
- 67%
Integrated Development Environment with Interactive Scatter Plot for Examining Statistical Modeling
CHI '20· Interactive Data Visualization +1
- 67%
NBSearch: Semantic Search and Visual Exploration of Computational Notebooks
CHI '21· Interactive Data Visualization +1
- 67%
ComputableViz: Mathematical Operators as a Formalism for Visualization Processing and Analysis
CHI '22· Interactive Data Visualization +1
- 67%
multiverse: Multiplexing Alternative Data Analyses in R Notebooks
CHI '23· Interactive Data Visualization +1
Based on Jaccard similarity of research subtopics & professions (≥60%)
Quick Actions
AdRecommended
Learn AI Coding at CodeNow
open_in_newOpen DOI Link
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3502123
At a Glance
fact_checkPaper Snapshot
dataset
Source
CHI
calendar_month
Year
2022
emoji_events
Award
No award tagged
group
Authors
4 authors
sell
Subtopics
Interactive Data Visualization, Visualization Perception & Cognition, Computational Methods in HCI
work
Professions
Software Engineers & Developers, Data Scientists & Analysts, Statisticians & Data Scientists
article
Content Status
Full text indexed
hub
Related Papers
10 related papers