Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics
Authors
Paper Title
Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics
Publication Info
- Topic area: Evaluation of Large Language Models (LLMs) for Conversational Visual Analytics (CVA).
- Keywords: Conversational Visual Analytics, Large Language Models, evaluation toolkit, visualization quality, natural language metrics, multi-turn interactions, ambiguity resolution, user-centered design.
Background and Problem
- Problem / challenge: Existing CVA evaluation methods are fragmented, require programming expertise, focus on single-turn interactions, and lack interpretable metrics for multi-format outputs (visualizations and text).
- Significance: Evaluating LLMs for CVA is critical for ensuring trust, usability, and analytical accuracy in systems that democratize data exploration.
- Motivation and related work: Prior CVA tools and benchmarks fail to capture real-world multi-turn, multi-format interactions and often overlook ambiguity and iterative refinement. Traditional NLP metrics struggle with CVA-specific outputs, and visualization-specific metrics lack comprehensive pipeline coverage.
Solution
- Proposed approach: Lexara, a user-centered evaluation toolkit for CVA, operationalizes real-world insights into test cases, interpretable metrics, and an interactive low-code benchmarking tool.
- Novelty:
- Real-world CVA test cases capturing multi-turn, multi-format interactions.
- Graded, interpretable metrics for visualization and natural language quality, accommodating multiple plausible answers.
- An interactive, low-code evaluation tool enabling systematic comparison of models and prompts.
- Procedure and key techniques:
- Semi-structured interviews with 22 CVA developers and observational studies with 16 end-users informed test case design.
- Metrics evaluate visualization quality (data fidelity, semantic alignment, functional correctness, design clarity) and language quality (factual grounding, analytical reasoning, conversational coherence).
- Interactive interface supports uploading datasources, configuring experiments, and inspecting multi-format outputs side-by-side.
Results
- Concrete findings:
- Lexara’s metrics align with human judgments (Spearman’s ρ = 0.68–0.82 for visualization metrics; ρ = 0.57–0.82 for natural language metrics).
- Diary study participants conducted 38 experiments across 57 test cases, comparing 10 LLMs and 6 system prompts.
- Advantage over baselines:
- Lexara’s test cases and metrics capture real-world complexity better than synthetic benchmarks.
- Graded correctness and multi-format evaluation provide nuanced insights absent in traditional NLP or visualization metrics.
- Experiments / evaluation:
- Validation study with human raters showed high inter-rater reliability (Cohen’s κ = 0.45–0.80).
- Diary study participants valued Lexara’s interpretability, scalability, and support for multi-format comparisons.
- Limitations and future work:
- Current test suite coverage is limited to specific domains and common chart types.
- YAML-based authoring poses challenges for non-technical users; future iterations may include point-and-click interfaces.
- Metrics do not yet assess multimodal perception or tool-use capabilities of LLMs.
Summary
Lexara addresses critical gaps in evaluating LLMs for Conversational Visual Analytics by introducing real-world test cases, interpretable graded metrics, and an interactive low-code benchmarking tool. Validation studies demonstrate alignment between Lexara’s metrics and human judgments, while diary studies highlight its usability and diagnostic capabilities for practitioners. By enabling nuanced, scalable evaluation of multi-turn, multi-format CVA interactions, Lexara contributes to more trustworthy and user-centered development of LLM-based analytics systems. The toolkit is publicly available for broader adoption and extension.
Research Questions / Practical Problems
Question signals indexed for this paper.
- 86%
PleaSQLarify: Visual Pragmatic Repair for Natural Language Database Querying
CHI '26· Human-LLM Collaboration +2
- 86%
OntoScope: Using a Divergent-Convergent Interaction Framework to Support LLM-based Ontology Scoping
IUI '26· Human-LLM Collaboration +2
- 86%
SCSimulator: An Exploratory Visual Analytics Framework for Partner Selection in Supply Chains through LLM-driven Multi-Agent Simulation
IUI '26· Human-LLM Collaboration +2
- 86%
Improving Steering and Verification in AI-Assisted Data Analysis with Interactive Task Decomposition
UIST '24· Human-LLM Collaboration +2
- 75%
VeriPlan: Integrating Formal Verification and LLMs into End-User Planning
CHI '25· Human-LLM Collaboration +2
- 71%
Wikipedia ORES Explorer: Visualizing Trade-offs For Designing Applications With Machine Learning API
DIS '21· Explainable AI (XAI) +1
- 71%
ViseGPT: Towards Better Alignment of LLM-generated Data Wrangling Scripts and User Prompts
UIST '25· Human-LLM Collaboration +2
- 67%
Interactive Reasoning: Visualizing and Controlling Chain-of-Thought Reasoning in Large Language Models
IUI '26· Human-LLM Collaboration +3
- 63%
Gamut: A Design Probe to Understand How Data Scientists Understand Machine Learning Models
CHI '19· Explainable AI (XAI) +2
- 63%
VizNet: Towards A Large-Scale Visualization Learning and Benchmarking Repository
CHI '19· Interactive Data Visualization +1
Based on Jaccard similarity of research subtopics & professions (≥60%)