SalChartQA: Question-driven Saliency on Information Visualisations
Authors
Explainable AI (XAI)Interactive Data VisualizationVisualization Perception & CognitionSoftware Engineers & DevelopersHCI ResearchersStatisticians & Data Scientists
Title of the Paper
SalChartQA: Question-driven Saliency on Information Visualisations
Bibliographic Information
- Domain: Information Visualization and Visual Attention Modeling
- Keywords: Information Visualization, Eye-tracking Studies, Gaze Behavior, Visual Saliency, Deep Learning
Research Background and Problem
- Identified Problems or Challenges:
- Current research lacks large-scale, diverse datasets to explore the relationship between visual attention and user information needs.
- User attention behavior in information visualization has not been thoroughly linked to specific information needs (e.g., question-driven scenarios).
- Existing visual saliency models, particularly those tailored for information visualization, fail to accurately predict task (question)-driven saliency maps.
- Significance of Research:
- Analyzing visual attention behavior can enhance the clarity, memorability, and comprehensibility of information visualization design.
- Question-driven visual saliency research contributes to applications such as explainable artificial intelligence (XAI) and task-optimized visualization.
- Motivation and Related Work:
- Previous studies have primarily focused on saliency modeling for natural images and attention behavior under "free-viewing" conditions.
- Task-driven visual attention has been studied in contexts such as web browsing or gaming, but targeted methods and datasets for information visualization remain extremely limited.
Solution
-
Method or Solution:
- SalChartQA Dataset: Developed a large-scale, question-driven saliency dataset through crowdsourcing, comprising 3,000 visualizations, 6,000 questions, 74,340 answers, and corresponding saliency maps.
- Impact Analysis: Data analysis demonstrated the significant influence of questions on visual saliency.
- VisSalFormer Model: Proposed a Transformer-based model capable of predicting question-driven saliency maps for information visualization.
-
Innovations:
- SalChartQA is the first large-scale, question-driven saliency dataset, significantly expanding data scale and diversity in information needs.
- The VisSalFormer model integrates visualization and question semantics, achieving the first computational prediction of question-driven saliency.
-
Implementation Steps:
- Data Collection: Utilized the BubbleView interface on a crowdsourcing platform to track user click behavior, simulating visual attention and forming the SalChartQA dataset.
- Data Analysis: Analyzed the impact of question characteristics (e.g., type, length) on click count, saliency coverage, and attention consistency.
- Model Training: Trained VisSalFormer using SalChartQA to generate saliency maps by integrating visual and question features.
- Comparative Experiments: Compared VisSalFormer with five baseline methods and conducted ablation studies to evaluate component contributions.
Research Outcomes
-
Specific Results:
- Created a large-scale, question-driven dataset, SalChartQA (3,000 visualizations, 6,000 questions).
- The VisSalFormer model outperformed existing models across five saliency prediction metrics (e.g., NSS, CC, KL).
- Data analysis revealed the strong effect of information needs (questions) on visual saliency, further supporting the practical exploration of question-driven theories.
-
Comparison with Existing Solutions:
- Compared to traditional image feature-based models (e.g., DVS, TranSalNet), VisSalFormer can generate saliency maps directly linked to user questions.
- By incorporating question semantics, VisSalFormer demonstrated higher prediction accuracy and question-answer adaptability.
-
Experimental or Evaluation Results:
- VisSalFormer significantly outperformed TranSalNet in NSS scores (1.782 vs. 0.794) and showed statistically significant advantages in metrics such as CC and KL (p<0.001).
- Ablation studies indicated that the cross-modal feature fusion module and question embedding were key components for performance improvement.
-
Limitations and Future Directions:
-
Limitations:
- The BubbleView method cannot fully capture text-reading behavior, thus excluding text saliency analysis.
- In certain scenarios (e.g., when colors are similar), the model's predictions lack precision.
-
Future Directions:
- Explore the interaction between image and text saliency to develop joint models.
- Integrate question-driven saliency into chart question-answering systems (CQA) to enhance model performance and interpretability.
- Optimize information visualization design based on saliency analysis, such as improving user interaction efficiency with complex graphics.
- Use question accuracy as a metric for evaluating visualization quality and further investigate how design can improve the correctness of user answers.
-
Research Questions / Practical Problems
Question signals indexed for this paper.
help
Research Questions
3- How do users' question needs influence visual saliency in information visualization?Category: ML/AI Model Visualization and Explainable AnalysisSimilar questionsarrow_forward
- Can deep learning models predict task-driven, question-oriented visual saliency regions?Category: ML/AI Model Visualization and Explainable AnalysisSimilar questionsarrow_forward
- What kind of dataset design can effectively study the relationship between information needs and visual saliency?Category: ML/AI Model Visualization and Explainable AnalysisSimilar questionsarrow_forward
lightbulb
Practical Problems
1- Users do not know how to quickly find key information in visualizations to answer questions.Category: ML/AI Model Visualization and Explainable AnalysisSimilar questionsarrow_forward
- 71%
Do You See What You Mean? Using Predictive Visualizations to Reduce Optimism in Duration Estimates
CHI '22· Interactive Data Visualization +2
- 71%
Beyond Time and Accuracy: Strategies in Visual Problem-Solving
CHI '25· Eye Tracking & Gaze Interaction +2
- 71%
IKIWISI: An Interactive Visual Pattern Generator for Evaluating the Reliability of Vision-Language Models Without Ground Truth
DIS '25· Generative AI (Text, Image, Music, Video) +2
- 67%
Data-Driven Mark Orientation for Trend Estimation in Scatterplots
CHI '21· Interactive Data Visualization +1
- 67%
reVISit: Looking Under the Hood of Interactive Visualization Studies
CHI '21· Interactive Data Visualization +1
- 67%
Graphical Perception of Saliency-based Model Explanations
CHI '23· Explainable AI (XAI) +1
Based on Jaccard similarity of research subtopics & professions (≥60%)
Quick Actions
AdRecommended
Learn AI Coding at CodeNow
open_in_newOpen DOI Link
DOI: https://doi.org/10.1145/3613904.3642942
At a Glance
fact_checkPaper Snapshot
dataset
Source
CHI
calendar_month
Year
2024
emoji_events
Award
No award tagged
group
Authors
7 authors
sell
Subtopics
Explainable AI (XAI), Interactive Data Visualization, Visualization Perception & Cognition
work
Professions
Software Engineers & Developers, HCI Researchers, Statisticians & Data Scientists
article
Content Status
Full text indexed
hub
Related Papers
6 related papers