评估符合性预测集在AI辅助图像标注中的效用

荣誉提名
可解释人工智能(XAI)推荐系统用户体验不确定性可视化软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师

文献标题

Evaluating the Utility of Conformal Prediction Sets for AI-Advised Image Labeling

文献信息

  • 主题领域: 人工智能、机器学习与人类-计算机交互
  • 关键词: conformal prediction, uncertainty quantification, image labeling, AI-advised decision-making, comparative user experiment

研究背景与问题

  • 作者发现了哪些问题或挑战? 随着深度学习模型在人类决策的高风险领域中越来越普遍,其黑盒特性使得不确定性量化变得困难。现有神经网络输出的softmax置信度值往往过于自信,且不精确,难以有效辅助决策。即使呈现top-1或top-k预测,模型错误常引发更糟的决策。

  • 为什么这个问题很重要? 提供准确、不确定性保证的预测对改善人类与AI合作的决策质量具有重要意义,尤其是模型遇到分布外(out-of-distribution, OOD)样本时,这种不确定性量化的挑战加剧了。

  • 研究动机与相关工作
    基于分布无关的方法(例如符合性预测,conformal prediction),可以生成包含覆盖保证的预测集,即预测集保证以用户指定的概率(如95%)包含真实标签。本研究尝试评估该方法在AI辅助图像标注任务中的有效性,以及与传统top-k预测展示形式的比较。

解决方案

  • 作者提出了哪些方法或解决方案? 本研究通过进行大规模在线实验,比较了符合性预测集(用于量化预测模型的不确定性)的效用与top-1和top-k预测显示的效用。

  • 该解决方案的创新之处是什么?

    1. 提出了利用"Regularized Adaptive Prediction Sets (RAPS)"算法生成预测集,该算法以尽量小的集合实现期望的覆盖率。
    2. 系统性探讨了预测集在不同任务难度(易/难)及数据类型(分布内/in-distribution vs 分布外/OOD)的效果,评估模型预测在复杂场景中的表现。
  • 实施步骤是什么?使用了哪些关键技术?

    1. 生成实验图像样本,通过ILSVRC 2012训练集选定分布内样本,并通过合成图像扰动生成分布外样本。
    2. 设计实验条件:无预测显示(baseline)、top-1预测显示、top-10预测显示、RAPS预测集。
    3. 实验任务:600名参与者随机分组,对16张图像进行标注,记录准确率、最短路径长度(表示标注错误与真实标签的距离)以及参与者自愿支付金额等指标。
    4. 分析采用贝叶斯线性混合效应模型,控制实验变量,评估实验结果。

研究成果

  • 取得了哪些具体成果?

    1. 分布内场景下,较小的预测集能显著提高标注准确性;分布外场景下,无论预测集大小,RAPS均展现出更优性能。
    2. 实验证明,当预测模型较准确且分布内实例较易标注时,显示预测集对任务性能有辅助效果;但过多的预测信息可能增加认知负担,降低准确率。
    3. 对难的分布外实例,尽管预测集包含多个标签,参与者更依赖预测集,且提交的标签往往更接近正确答案。
  • 与现有解决方案相比,它有哪些优势? 符合性预测集提供了比传统top-k方法更具适应性且具有覆盖保证的预测,特别是在分布外样本上,显著提高了人类决策的准确性。

  • 实验或评估结果是什么?

    1. 分布内易例子:RAPS较小集提升准确率,平均标注准确率为74.2%,明显高于top-10和top-1。
    2. 分布外困难例子:RAPS预测集表现最好,复杂情况下基于大型预测集响应标签更接近真实答案。
    3. “愿意支付金额”(willingness-to-pay)实验提供了参与者对显示效果感知价值的经济指标,但RAPS价值普遍被低估。
  • 局限性与未来方向

    1. 实验未探索预测集覆盖率下降对参与者判断的影响,需要进一步研究不同覆盖水平对学习表现的影响。
    2. 在真实世界的建模中,适应性预测集可能面临意图干扰(例如对抗攻击),这一问题尚待解决。
    3. 在实验设计中,"愿意支付金额"评估难以量化与个体绩效更紧密的联系。未来计划扩展设计,以探究用户对预测显示的真正理解与偏好。

总结

本文通过大规模实验验证了通过符合性预测集量化不确定性在AI辅助决策场景中的效用。对于分布外样本,特别困难实例,RAPS预测集相比传统展示效果更佳。研究揭示了在深度学习模型实际应用场景中利用预测集的广泛潜力,同时指出了设计预测显示的关键注意点,例如预测集大小与用户认知负担的平衡。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/146876/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642446
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
荣誉提名
group
作者
4 位作者
sell
研究子方向
可解释人工智能(XAI)、推荐系统用户体验、不确定性可视化
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
6 篇相关论文