Lexara:用于评估对话式可视化分析中大语言模型的用户中心化工具包
大语言模型(LLM)的人机协作交互式数据可视化可解释人工智能(XAI)数据科学家与分析师AI/ML 研究员与工程师软件工程师与开发者HCI 研究员
文献标题
Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics
出版信息
- 主题领域: 面向对话式可视化分析(CVA)的大型语言模型(LLMs)评估。
- 关键词: 对话式可视化分析,大型语言模型,评估工具包,可视化质量,自然语言指标,多轮交互,歧义解决,以用户为中心的设计。
背景与问题
- 问题/挑战: 现有的CVA评估方法存在碎片化、需要编程技能、仅关注单轮交互,以及缺乏针对多格式输出(可视化和文本)的可解释指标等问题。
- 重要性: 对LLMs进行CVA评估对于确保系统的信任性、可用性和分析准确性至关重要,这些系统旨在实现数据探索的民主化。
- 动机与相关工作: 现有的CVA工具和基准未能全面捕捉真实世界中的多轮、多格式交互,且往往忽视歧义和迭代改进。传统的NLP指标难以处理CVA特定的输出,而可视化特定的指标缺乏对整个流程的全面覆盖。
解决方案
- 提出的方法: Lexara,一个面向用户的CVA评估工具包,将真实世界的洞见转化为测试用例、可解释指标和交互式低代码基准工具。
- 创新点:
- 捕捉多轮、多格式交互的真实世界CVA测试用例。
- 针对可视化和自然语言质量的分级、可解释指标,支持多种可能答案。
- 一个交互式低代码评估工具,支持系统性比较模型和提示。
- 流程与关键技术:
- 通过对22位CVA开发者的半结构化访谈和对16位终端用户的观察研究,设计了测试用例。
- 指标评估可视化质量(数据保真度、语义对齐、功能正确性、设计清晰度)和语言质量(事实依据、分析推理、对话连贯性)。
- 交互式界面支持上传数据源、配置实验以及并排检查多格式输出。
结果
- 具体发现:
- Lexara的指标与人工判断高度一致(可视化指标的Spearman相关系数ρ = 0.68–0.82;自然语言指标的ρ = 0.57–0.82)。
- 日记研究参与者完成了38个实验,涵盖57个测试用例,比较了10个LLMs和6种系统提示。
- 相较基线的优势:
- Lexara的测试用例和指标比合成基准更能捕捉真实世界的复杂性。
- 分级正确性和多格式评估提供了传统NLP或可视化指标所缺乏的细致洞见。
- 实验/评估:
- 人工评分验证研究显示高评分者间一致性(Cohen’s κ = 0.45–0.80)。
- 日记研究参与者认可Lexara的可解释性、可扩展性以及对多格式比较的支持。
- 局限性与未来工作:
- 当前测试套件的覆盖范围仅限于特定领域和常见图表类型。
- 基于YAML的创作方式对非技术用户存在挑战;未来版本可能引入点选界面。
- 指标尚未评估LLMs的多模态感知或工具使用能力。
总结
Lexara通过引入真实世界测试用例、可解释的分级指标以及交互式低代码基准工具,解决了LLMs在对话式可视化分析评估中的关键问题。验证研究表明,Lexara的指标与人工判断一致,而日记研究则突出了其对从业者的可用性和诊断能力。通过实现对多轮、多格式CVA交互的细致、可扩展评估,Lexara为基于LLM的分析系统的更可信和以用户为中心的开发做出了贡献。该工具包已公开发布,供更广泛的采用和扩展。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 86%
PleaSQLarify:面向自然语言数据库查询的视觉语用修复
CHI '26· 大语言模型(LLM)的人机协作 +2
- 86%
OntoScope:利用发散-收敛交互框架支持基于 LLM 的本体论范围界定
IUI '26· 大语言模型(LLM)的人机协作 +2
- 86%
SCSimulator:一种基于大语言模型多智能体模拟的供应链合作伙伴选择探索性可视化分析框架
IUI '26· 大语言模型(LLM)的人机协作 +2
- 86%
基于交互式任务分解的AI辅助数据分析引导与验证改进
UIST '24· 大语言模型(LLM)的人机协作 +2
- 75%
VeriPlan:将正式验证和大语言模型集成到终端用户规划中
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
Wikipedia ORES Explorer:机器学习API应用设计权衡的可视化
DIS '21· 可解释人工智能(XAI) +1
- 71%
ViseGPT: 实现 LLM 生成的数据整理脚本与用户提示的更好对齐
UIST '25· 大语言模型(LLM)的人机协作 +2
- 67%
交互式推理:可视化和控制大语言模型中的思维链推理
IUI '26· 大语言模型(LLM)的人机协作 +3
- 63%
色域:一项设计探针以理解数据科学家如何理解机器学习模型
CHI '19· 可解释人工智能(XAI) +2
- 63%
VizNet:迈向大规模可视化学习和基准测试库
CHI '19· 交互式数据可视化 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790735
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、交互式数据可视化、可解释人工智能(XAI)
work
职业/产业
数据科学家与分析师、AI/ML 研究员与工程师、软件工程师与开发者、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文