使多模态大语言模型成为可靠的图表数据提取器:基准测试与训练框架
作者
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作交互式数据可视化软件工程师与开发者数据科学家与分析师AI/ML 研究员与工程师
文献标题
Making Multimodal LLMs Reliable Chart Data Extractors: A Benchmark and Training Framework
出版信息
- 主题领域: 使用多模态大语言模型(MLLMs)进行图表数据提取。
- 关键词: 图表数据提取、多模态大语言模型、ExChart、ExChart-Bench、坐标系统感知、图表到表格对齐、数值准确性、混合式交互工作流、可视化、人机交互。
背景与问题
- 问题与挑战: 当前的图表数据提取方法,包括全自动、交互式和混合式系统,在效率、通用性和数值准确性方面存在困难,尤其是对于没有可见数据标签的图表。虽然多模态大语言模型(MLLMs)具有潜力,但在精确值恢复方面仍不可靠。
- 重要性: 可靠的图表数据提取对于研究、金融和政策等领域的可重复性、分析和可访问性至关重要。不准确的提取可能导致错误的分析和决策。
- 动机与相关工作: 现有系统如 ChartOCR 和 WebPlotDigitizer 要么脆弱,要么繁琐。混合式交互系统提高了效率,但缺乏通用性。MLLMs 提供了统一的界面,但在没有标签的情况下无法准确推断值。本文通过改进 MLLM 的图表数据提取性能来解决这些问题。
解决方案
- 提出的方法: 作者提出了 ExChart,一个受人类图表阅读过程启发的两阶段训练框架,以及 ExChart-Bench,一个用于评估图表数据提取性能的基准。
- 创新点:
- 开发 ExChart-Bench,一个包含真实世界和合成图表(无数据标签)的基准。
- 引入两阶段训练框架(坐标系统感知增强和图表-表格对齐),以提升 MLLM 的性能。
- 使用轻量级 7B 参数模型展示了最先进的性能。
- 通过用户研究验证了框架在混合式交互工作流中的有效性。
- 流程与关键技术:
- 坐标系统感知增强(CSPE): 训练模型理解坐标几何和视觉编码。
- 图表-表格对齐(CTA): 微调模型以生成具有高数值准确性的结构化数据表。
- 构建 ExChart-Bench: 包括 3,600 个图表-表格-提示对,涵盖多种图表类型和风格,以自适应 MAPE 作为主要评估指标。
- 用户研究评估 MLLM 在交互式工作流中的整合效果。
结果
- 具体发现:
- ExChart 实现了 4.87% 的自适应 MAPE,显著优于基础模型(16.01%)和更大的模型如 GLM-4.5V(5.94%)。
- 格式成功率从 89.58% 提升至 99.11%。
- 在处理极坐标图表方面取得显著改进(例如雷达图:自适应 MAPE 从 25.47% 降至 3.21%)。
- 相较基线的优势:
- ExChart 在数值准确性和结构化输出生成方面优于最先进的模型如 GLM-4.5V 和 Gemini 2.5 Flash。
- 与图表专用模型(如 ChartInstruct、UniChart)相比,在 RNSS 和 RMS 指标上表现更优。
- 实验与评估:
- 使用 ExChart-Bench 对 11 个 MLLM 进行了基准测试,涵盖 3,600 个图表。
- 通过消融研究验证了 CSPE 和 CTA 阶段的贡献。
- 用户研究中,12 名参与者表明 MLLM 辅助工作流能够实现高效且可靠的图表数据提取,平均 SUS 得分为 94.79。
- 局限性与未来工作:
- 当前模型,即使使用 ExChart,仍不足以实现完全自动化提取。
- 未来工作包括扩展图表多样性、探索表格形状影响以及引入不确定性估计以增强可解释性。
总结
本文通过引入 ExChart(一种受人类启发的两阶段训练框架)和 ExChart-Bench(一个系统评估基准),解决了 MLLM 在图表数据提取中的局限性。所提出的方法显著提高了数值准确性和结构化输出生成能力,并使用轻量级 7B 参数模型实现了最先进的性能。用户研究证实了将 MLLM 整合到混合式交互工作流中的有效性,从而实现高效且可靠的图表数据提取。这些发现突显了结合定制化训练策略与人机协作在实际应用中的潜力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 83%
通过自动生成的图像画廊探索生成对抗网络(GANs)的方法
CHI '21· 生成式AI(文本、图像、音乐、视频) +2
- 83%
Flowco:通过数据流图和大型语言模型实现可靠端到端数据分析的混合主动式创作系统
UIST '25· 生成式AI(文本、图像、音乐、视频) +2
- 71%
Jupybara:利用LLM实现可用于操作的数据分析和叙事设计空间
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
Dango:使用大型语言模型的混合发起数据整理系统
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
PleaSQLarify:面向自然语言数据库查询的视觉语用修复
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
SCSimulator:一种基于大语言模型多智能体模拟的供应链合作伙伴选择探索性可视化分析框架
IUI '26· 大语言模型(LLM)的人机协作 +2
- 71%
基于交互式任务分解的AI辅助数据分析引导与验证改进
UIST '24· 大语言模型(LLM)的人机协作 +2
- 71%
Reality Proxy:通过抽象表示实现MR中真实物体的流体交互
UIST '25· 混合现实工作空间 +2
- 67%
大规模可视化深度神经网络示例
CHI '21· 大语言模型(LLM)的人机协作 +1
- 67%
使用生成语言模型发现自然语言编程的语法和策略
CHI '22· 生成式AI(文本、图像、音乐、视频) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790721
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、交互式数据可视化
work
职业/产业
软件工程师与开发者、数据科学家与分析师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文