随着大语言模型的广泛可用性及其使用不同提示和配置生成大量输出的能力,确定给定任务的最佳输出需要一个密集的评估过程,机器学习从业者必须决定如何评估输出,然后仔细执行评估。这个过程既耗时又昂贵。随着从业者使用越来越多的模型,他们现在必须评估输出以确定哪个模型在给定任务上表现最佳。LLM 越来越多地被用作评估器来过滤训练数据、评估模型性能或协助人工评估者进行详细评估。我们的应用程序 EvalAssist 通过帮助用户交互式细化评估标准来支持这一过程。我们在与机器学习从业者(n=15)的研究中,每个人完成 6 项任务,产生 131 项评估,探索了任务相关因素和判断策略如何影响标准细化和用户感知。结果显示,用户通过使标准任务特定化、修改判断和更改 AI 评估器模型,进行了更多直接评估。我们最后提出了关于系统如何更好地支持从业者进行 AI 辅助评估的建议。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/206916/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3746059.3747740
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
10 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
数据科学家与分析师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文