iScore:用于解释语言模型自动评分摘要的可视化分析

可解释人工智能(XAI)交互式数据可视化UI/UX 设计师数据科学家与分析师AI/ML 研究员与工程师

大型语言模型(LLM)的普及激发了学习工程师将它们纳入自动评分摘要写作的自适应教育工具中。在将LLM部署到关键学习环境之前,理解和评估LLM至关重要,但它们前所未有的规模和不断增长的参数数量阻碍了透明度,并在模型表现不佳时阻碍信任。通过与几位构建和部署摘要评分LLM的学习工程师进行协作式以用户为中心的设计过程,我们确定了围绕模型解释的基本设计挑战和目标,包括聚合大型文本输入、跟踪评分来源和扩展LLM解释方法。为解决他们的问题,我们开发了iScore,这是一个供学习工程师上传、同时对多个摘要进行评分和比较的交互式可视化分析工具。紧密集成的视图允许用户迭代修改摘要中的语言,跟踪结果LLM分数的变化,并在多个抽象层级可视化模型权重。为验证我们的方法,我们与三位学习工程师一起部署了iScore,为期一个月。我们展示了一个案例研究,其中与iScore的交互使学习工程师将LLM的评分准确率提高了三个百分点。最后,我们对学习工程师进行的定性访谈揭示了iScore如何使他们在部署过程中理解、评估和建立对LLM的信任。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/139200/2024

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
可解释人工智能(XAI)、交互式数据可视化
work
职业/产业
UI/UX 设计师、数据科学家与分析师、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文