不仅仅是营销?关于人工智能基准测试对从业者的信息价值
作者
公共AI基准测试结果被模型开发商广泛宣传为模型质量的指标,在一个日益增长和竞争激烈的市场中。然而,这些广告宣传的分数不一定反映那些最终应用AI模型的人所感兴趣的特征。本文旨在了解AI基准测试是否以及如何被用于决策。基于对19名在日常工作中使用或决定不使用基准测试的个人的访谈分析,我们发现,在这些设置中,参与者将基准测试用作模型之间相对性能差异的信号。然而,这种信号是否被视为模型优势的明确标志,是否足以用于下游决策,情况各不相同。在学术界,公共基准测试通常被认为是适合捕获研究进展的衡量标准。相比之下,在产品和政策领域,基准测试——即使是为特定任务在内部开发的——通常被认为是不足以告知实质性决策的。对于被认为不令人满意的基准测试,受访者报告说,他们的目标既没有明确定义,也不反映现实世界的使用。基于研究结果,我们得出结论,有效的基准测试应提供有意义的真实世界评估,纳入领域专业知识,并在范围和目标方面保持透明。它们必须捕获多样化的、与任务相关的能力,具有足够的挑战性以避免快速饱和,并考虑模型性能的权衡,而不是依赖单一分数。此外,专有数据收集和污染预防对于产生可靠和可操作的结果至关重要。通过遵守这些标准,基准测试可以超越单纯的营销技巧,成为准确的框架,以准确反映AI进展并在研究和实际领域指导明智的决策。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 80%
每个人都想做模型工作,而不是数据工作:高风险人工智能中的数据级联
CHI '21· 可解释人工智能(XAI) +1
- 80%
文本分类中的公平性评估:机器学习从业者对个体和群体公平性的看法
CHI '23· 可解释人工智能(XAI) +1
- 80%
对机器学习中多重性公平影响的认知
CHI '25· 可解释人工智能(XAI) +1
- 67%
分歧去卷积:将机器学习性能指标与现实接轨
CHI '21· 可解释人工智能(XAI) +1
- 67%
超越专业知识和角色:一个框架来描述可解释机器学习的利益相关者及其需求
CHI '21· 可解释人工智能(XAI) +2
- 67%
AI调解的决策制定:捕捉和平衡顺序决策任务中的锚定偏差
CHI '22· 可解释人工智能(XAI) +2
- 67%
数据科学中的遗忘实践
CHI '22· 可解释人工智能(XAI) +1
- 67%
《你真的确定吗?》理解人类自我信心校准在人工智能辅助决策中的影响
CHI '24· 可解释人工智能(XAI) +1
- 67%
用户驱动的价值观对齐:理解用户对AI伴侣中偏见和歧视性陈述的看法及应对策略
CHI '25· 可解释人工智能(XAI) +2
- 67%
Wikipedia ORES Explorer:机器学习API应用设计权衡的可视化
DIS '21· 可解释人工智能(XAI) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)