EvalAssist:任务特定评估与 AI 辅助判断策略偏好的见解
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统数据科学家与分析师AI/ML 研究员与工程师HCI 研究员
随着大语言模型的广泛可用性及其使用不同提示和配置生成大量输出的能力,确定给定任务的最佳输出需要一个密集的评估过程,机器学习从业者必须决定如何评估输出,然后仔细执行评估。这个过程既耗时又昂贵。随着从业者使用越来越多的模型,他们现在必须评估输出以确定哪个模型在给定任务上表现最佳。LLM 越来越多地被用作评估器来过滤训练数据、评估模型性能或协助人工评估者进行详细评估。我们的应用程序 EvalAssist 通过帮助用户交互式细化评估标准来支持这一过程。我们在与机器学习从业者(n=15)的研究中,每个人完成 6 项任务,产生 131 项评估,探索了任务相关因素和判断策略如何影响标准细化和用户感知。结果显示,用户通过使标准任务特定化、修改判断和更改 AI 评估器模型,进行了更多直接评估。我们最后提出了关于系统如何更好地支持从业者进行 AI 辅助评估的建议。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 83%
并非越多越好:在多AI建议中平衡决策准确性与从众压力
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
调试缺陷可视化:实证洞察助力人机协同调试系统设计
CHI '26· 交互式数据可视化 +2
- 83%
说服的机器人:研究对话式智能体的人格化语言表达如何影响用户感知与决策
CHI '26· 会话代理的人格与拟人化 +2
- 83%
多任务人机交互中的信念更新与委托:以受控模拟为证据
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
多智能体议价中人与人工智能的战略权衡
IUI '26· 大语言模型(LLM)的人机协作 +2
- 83%
使智能摘要界面中的缺失可见
IUI '26· 大语言模型(LLM)的人机协作 +2
- 83%
“非默认”行为调整:利用大语言模型自播和自改进指定规范外模型行为
IUI '26· 大语言模型(LLM)的人机协作 +2
- 80%
人类与AI交互中沟通方向性和AI代理差异的影响
CHI '21· 大语言模型(LLM)的人机协作 +1
- 80%
人工智能知识:通过人类赋能提升人工智能委托
CHI '23· 大语言模型(LLM)的人机协作 +1
- 80%
数据分析师如何回应AI辅助?一项巫师实验研究
CHI '24· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3746059.3747740
一眼看懂
fact_check论文快照
dataset
来源
UIST
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
10 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
数据科学家与分析师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文