iScore:用于解释语言模型自动评分摘要的可视化分析
作者
可解释人工智能(XAI)交互式数据可视化UI/UX 设计师数据科学家与分析师AI/ML 研究员与工程师
大型语言模型(LLM)的普及激发了学习工程师将它们纳入自动评分摘要写作的自适应教育工具中。在将LLM部署到关键学习环境之前,理解和评估LLM至关重要,但它们前所未有的规模和不断增长的参数数量阻碍了透明度,并在模型表现不佳时阻碍信任。通过与几位构建和部署摘要评分LLM的学习工程师进行协作式以用户为中心的设计过程,我们确定了围绕模型解释的基本设计挑战和目标,包括聚合大型文本输入、跟踪评分来源和扩展LLM解释方法。为解决他们的问题,我们开发了iScore,这是一个供学习工程师上传、同时对多个摘要进行评分和比较的交互式可视化分析工具。紧密集成的视图允许用户迭代修改摘要中的语言,跟踪结果LLM分数的变化,并在多个抽象层级可视化模型权重。为验证我们的方法,我们与三位学习工程师一起部署了iScore,为期一个月。我们展示了一个案例研究,其中与iScore的交互使学习工程师将LLM的评分准确率提高了三个百分点。最后,我们对学习工程师进行的定性访谈揭示了iScore如何使他们在部署过程中理解、评估和建立对LLM的信任。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何设计视觉分析工具以解释大型语言模型在自动评分摘要中的工作机制?分类: 机器学习模型可视化、调试与可解释性支持同类问题arrow_forward
- 输入扰动和注意力可视化如何揭示模型评分中的潜在偏差和逻辑问题?分类: 机器学习模型可视化、调试与可解释性支持同类问题arrow_forward
- 多视图集成方法如何提升模型解释性和用户友好性?分类: 机器学习模型可视化、调试与可解释性支持同类问题arrow_forward
lightbulb
现实痛点
1- 教育技术中,学习工程师难以理解语言模型的摘要评分机制。分类: 机器学习模型可视化、调试与可解释性支持同类问题arrow_forward
- 83%
分析师如何理解和验证AI辅助的数据分析?
CHI '24· 大语言模型(LLM)的人机协作 +2
- 83%
交互式可解释排序
CHI '26· 可解释人工智能(XAI) +2
- 80%
FDHelper:通过交互式特征选择和评估辅助无监督欺诈检测专家
CHI '20· 可解释人工智能(XAI) +1
- 80%
设计可信:数据可视化中观众对信任的看法
CHI '25· 可解释人工智能(XAI) +1
- 80%
视觉分析中未完全指定自然语言话语的推理
IUI '19· 可解释人工智能(XAI) +1
- 71%
VeriPlan:将正式验证和大语言模型集成到终端用户规划中
CHI '25· 大语言模型(LLM)的人机协作 +2
- 67%
在可视化工具设计中考虑代理和数据粒度
CHI '18· 可解释人工智能(XAI) +2
- 67%
我应该相信谁:AI还是我自己?利用人类和AI正确的可能性来促进对AI辅助决策的适当信任
CHI '23· 可解释人工智能(XAI) +1
- 67%
AnchorViz:通过交互式语义数据探索促进分类器错误发现
IUI '18· 可解释人工智能(XAI) +2
- 67%
定制化对可视化分析仪表板可用性的影响:好的、坏的和丑的
IUI '25· 交互式数据可视化 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
可解释人工智能(XAI)、交互式数据可视化
work
职业/产业
UI/UX 设计师、数据科学家与分析师、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文