Lexara:用于评估对话式可视化分析中大语言模型的用户中心化工具包

大语言模型(LLM)的人机协作交互式数据可视化可解释人工智能(XAI)数据科学家与分析师AI/ML 研究员与工程师软件工程师与开发者HCI 研究员

文献标题

Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics

出版信息

  • 主题领域: 面向对话式可视化分析(CVA)的大型语言模型(LLMs)评估。
  • 关键词: 对话式可视化分析,大型语言模型,评估工具包,可视化质量,自然语言指标,多轮交互,歧义解决,以用户为中心的设计。

背景与问题

  • 问题/挑战: 现有的CVA评估方法存在碎片化、需要编程技能、仅关注单轮交互,以及缺乏针对多格式输出(可视化和文本)的可解释指标等问题。
  • 重要性: 对LLMs进行CVA评估对于确保系统的信任性、可用性和分析准确性至关重要,这些系统旨在实现数据探索的民主化。
  • 动机与相关工作: 现有的CVA工具和基准未能全面捕捉真实世界中的多轮、多格式交互,且往往忽视歧义和迭代改进。传统的NLP指标难以处理CVA特定的输出,而可视化特定的指标缺乏对整个流程的全面覆盖。

解决方案

  • 提出的方法: Lexara,一个面向用户的CVA评估工具包,将真实世界的洞见转化为测试用例、可解释指标和交互式低代码基准工具。
  • 创新点:
    1. 捕捉多轮、多格式交互的真实世界CVA测试用例。
    2. 针对可视化和自然语言质量的分级、可解释指标,支持多种可能答案。
    3. 一个交互式低代码评估工具,支持系统性比较模型和提示。
  • 流程与关键技术:
    • 通过对22位CVA开发者的半结构化访谈和对16位终端用户的观察研究,设计了测试用例。
    • 指标评估可视化质量(数据保真度、语义对齐、功能正确性、设计清晰度)和语言质量(事实依据、分析推理、对话连贯性)。
    • 交互式界面支持上传数据源、配置实验以及并排检查多格式输出。

结果

  • 具体发现:
    • Lexara的指标与人工判断高度一致(可视化指标的Spearman相关系数ρ = 0.68–0.82;自然语言指标的ρ = 0.57–0.82)。
    • 日记研究参与者完成了38个实验,涵盖57个测试用例,比较了10个LLMs和6种系统提示。
  • 相较基线的优势:
    • Lexara的测试用例和指标比合成基准更能捕捉真实世界的复杂性。
    • 分级正确性和多格式评估提供了传统NLP或可视化指标所缺乏的细致洞见。
  • 实验/评估:
    • 人工评分验证研究显示高评分者间一致性(Cohen’s κ = 0.45–0.80)。
    • 日记研究参与者认可Lexara的可解释性、可扩展性以及对多格式比较的支持。
  • 局限性与未来工作:
    • 当前测试套件的覆盖范围仅限于特定领域和常见图表类型。
    • 基于YAML的创作方式对非技术用户存在挑战;未来版本可能引入点选界面。
    • 指标尚未评估LLMs的多模态感知或工具使用能力。

总结

Lexara通过引入真实世界测试用例、可解释的分级指标以及交互式低代码基准工具,解决了LLMs在对话式可视化分析评估中的关键问题。验证研究表明,Lexara的指标与人工判断一致,而日记研究则突出了其对从业者的可用性和诊断能力。通过实现对多轮、多格式CVA交互的细致、可扩展评估,Lexara为基于LLM的分析系统的更可信和以用户为中心的开发做出了贡献。该工具包已公开发布,供更广泛的采用和扩展。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/221866/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790735
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、交互式数据可视化、可解释人工智能(XAI)
work
职业/产业
数据科学家与分析师、AI/ML 研究员与工程师、软件工程师与开发者、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文