How Data Analysts Use a Visualization Grammar in Practice
Title of the Paper
How Data Analysts Use a Visualization Grammar in Practice
Paper Information
- Subject Area: Data Visualization and Human-Computer Interaction
- Keywords: Visualization Grammar, TidyTuesday, Computational Notebooks, Data Analysis, ggplot2, Data Wrangling, Data Visualization, Layered Grammar, Interactive Visualization, Visualization Errors
Research Background and Problem
-
Identified Problems or Challenges:
- Although visualization tools based on the Grammar of Graphics (GoG) have theoretical advantages, there is limited understanding of how analysts actually use these tools and the difficulties they may encounter.
- The design of visualization grammars may not fully align with analysts' actual practices and needs, potentially leading to hard-to-detect "silent errors," i.e., errors that produce reasonable outputs but contain underlying issues.
- There is a lack of research on how visualization grammars integrate with real-world data analysis workflows.
-
Significance:
- Understanding how analysts genuinely use visualization tools can help improve grammar design, making them more practical and user-friendly, thereby helping analysts avoid errors.
-
Research Motivation and Related Work:
- GoG-based visualization tools (e.g., ggplot2 in R and Vega in JavaScript) have been widely adopted in recent years.
- Existing studies often rely on experimental methods, such as asking participants to replicate given visualizations, which fail to reveal how analysts iteratively explore data through visualization.
- There is a need to deeply understand how analysts use visualization grammars in real-world programming environments like computational notebooks to inform tool design improvements.
Solution
-
Research Methods:
- Conducted a qualitative study with six intermediate to advanced users from the TidyTuesday community.
- Collected screen recordings of users performing data analysis and visualization with ggplot2, followed by retrospective interviews.
- Applied "reflexive thematic analysis" to analyze user data and extract patterns and usage behaviors.
-
Key Findings and Innovations:
- Alignment of GoG Grammar Components with Analysts' Tasks:
- The intended design of the grammar (e.g., modularity) does not always align directly with analysts' customization needs or practical requirements.
- Feedback Loop Between Analysis and Visualization:
- A "feedback loop" exists between data wrangling and visualization operations, where data outputs influence visualization design, and visualization results, in turn, affect data wrangling.
- This highly coupled process can improve efficiency but may also lead to consistency issues and potential errors.
- Silent Errors and Challenges in Evaluating Visualizations:
- Common silent errors include mismatches in data semantics, which can occur between data wrangling and visualization.
- Analysts' Iterative Patterns:
- Two iterative patterns were observed: "incremental" and "experimental," which support the original design intent of the GoG grammar.
- Use and Need for Visualization Templates:
- Analysts tend to rely on "visualization templates," which help them quickly create similar charts.
- Alignment of GoG Grammar Components with Analysts' Tasks:
-
Implementation Steps and Key Techniques:
- Used structured observation and interview techniques to document analysts' visualization and wrangling processes in TidyTuesday projects.
- Extracted code logs and behavioral patterns from screen recordings and interview data using reflexive thematic analysis.
- Analyzed the differences between user-customized grammars and the standard GoG design from statistical and graphical perspectives.
Research Outcomes
-
Specific Outcomes:
- Identified typical patterns in analysts' use of GoG grammar and common difficulties encountered during grammar execution and iterative processes.
- Conducted quantitative analysis of usage habits in the TidyTuesday community codebase, finding that participants' usage patterns were representative.
- Proposed key design recommendations for improving visualization grammars, including support for custom templates and enhanced consistency validation between data and visualizations.
-
Advantages:
- The study is based on real user data, covering various challenges encountered in practical analysis applications rather than theoretical or lab-based explorations.
- Implemented an integrated research framework combining analysis and feedback, capable of revealing complex iterative processes.
-
Experimental or Evaluation Results:
- Participants' average code files involved reasonable amounts of data wrangling and visualization editing, consistent with typical TidyTuesday practices.
- Identified two main types of silent errors during the experiments and provided specific case analyses.
-
Limitations and Future Directions:
- The participant group may be biased, as all users were from the active TidyTuesday community and likely more familiar with ggplot2 and related tools.
- Future research could expand to other GoG-style visualization grammar tools (e.g., Vega-Lite).
- Further exploration is needed on improving visualization grammars in programming environments (e.g., computational notebooks), focusing on enhancing transparency and consistency in analysis and visualization tasks.
Research Questions / Practical Problems
Question signals indexed for this paper.
Research Questions
3- How do data analysts use grammar of graphics (e.g., ggplot2) for visualization tasks in practice?Category: Visual Authoring, Dashboards, and Chart ComprehensionSimilar questionsarrow_forward
- How does the iterative data-wrangling-visualization feedback process affect data analysis efficiency and potential errors?Category: Visual Authoring, Dashboards, and Chart ComprehensionSimilar questionsarrow_forward
- How can grammar of graphics design be improved to meet data analysts' practical needs and reduce silent errors?Category: Visual Authoring, Dashboards, and Chart ComprehensionSimilar questionsarrow_forward
Practical Problems
1- Data analysts struggle to efficiently customize visualizations while avoiding hard-to-detect errors.Category: Visual Authoring, Dashboards, and Chart ComprehensionSimilar questionsarrow_forward
- 80%
Tessera: Discretizing Data Analysis Workflows on a Task Level
CHI '21· Interactive Data Visualization +1
- 80%
Chartist: Task-driven Eye Movement Control for Chart Reading
CHI '25· Interactive Data Visualization +1
- 80%
B2: Bridging Code and Interactive Visualization in Computational Notebooks
UIST '20· Interactive Data Visualization +1
- 71%
VisUnit: Literate Visualisation Studies Assembled from Reusable Test-Suites
CHI '25· Interactive Data Visualization +3
- 67%
CrossData: Leveraging Text-Data Connections for Authoring Data Documents
CHI '22· Interactive Data Visualization +1
- 67%
Automatic Synthesis of Visualization Design Knowledge Bases
CHI '26· Interactive Data Visualization +2
- 67%
Familiarisation: Restructuring Layouts with Visual Learning Models
IUI '18· Interactive Data Visualization +2
- 60%
The Story in the Notebook: Exploratory Data Science using a Literate Programming Tool
CHI '18· Interactive Data Visualization +1
- 60%
How Data Science Workers Work with Data: Discovery, Capture, Curation, Design, Creation
CHI '19· Interactive Data Visualization +1
- 60%
Falx: Synthesis-Powered Visualization Authoring
CHI '21· Interactive Data Visualization
Based on Jaccard similarity of research subtopics & professions (≥60%)