不仅仅是营销?关于人工智能基准测试对从业者的信息价值

可解释人工智能(XAI)算法公平与偏见软件工程师与开发者AI/ML 研究员与工程师HCI 研究员

公共AI基准测试结果被模型开发商广泛宣传为模型质量的指标,在一个日益增长和竞争激烈的市场中。然而,这些广告宣传的分数不一定反映那些最终应用AI模型的人所感兴趣的特征。本文旨在了解AI基准测试是否以及如何被用于决策。基于对19名在日常工作中使用或决定不使用基准测试的个人的访谈分析,我们发现,在这些设置中,参与者将基准测试用作模型之间相对性能差异的信号。然而,这种信号是否被视为模型优势的明确标志,是否足以用于下游决策,情况各不相同。在学术界,公共基准测试通常被认为是适合捕获研究进展的衡量标准。相比之下,在产品和政策领域,基准测试——即使是为特定任务在内部开发的——通常被认为是不足以告知实质性决策的。对于被认为不令人满意的基准测试,受访者报告说,他们的目标既没有明确定义,也不反映现实世界的使用。基于研究结果,我们得出结论,有效的基准测试应提供有意义的真实世界评估,纳入领域专业知识,并在范围和目标方面保持透明。它们必须捕获多样化的、与任务相关的能力,具有足够的挑战性以避免快速饱和,并考虑模型性能的权衡,而不是依赖单一分数。此外,专有数据收集和污染预防对于产生可靠和可操作的结果至关重要。通过遵守这些标准,基准测试可以超越单纯的营销技巧,成为准确的框架,以准确反映AI进展并在研究和实际领域指导明智的决策。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/195772/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3708359.3712152
一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
9 位作者
sell
研究子方向
可解释人工智能(XAI)、算法公平与偏见
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文