评估符合性预测集在AI辅助图像标注中的效用
荣誉提名文献标题
Evaluating the Utility of Conformal Prediction Sets for AI-Advised Image Labeling
文献信息
- 主题领域: 人工智能、机器学习与人类-计算机交互
- 关键词: conformal prediction, uncertainty quantification, image labeling, AI-advised decision-making, comparative user experiment
研究背景与问题
-
作者发现了哪些问题或挑战? 随着深度学习模型在人类决策的高风险领域中越来越普遍,其黑盒特性使得不确定性量化变得困难。现有神经网络输出的softmax置信度值往往过于自信,且不精确,难以有效辅助决策。即使呈现top-1或top-k预测,模型错误常引发更糟的决策。
-
为什么这个问题很重要? 提供准确、不确定性保证的预测对改善人类与AI合作的决策质量具有重要意义,尤其是模型遇到分布外(out-of-distribution, OOD)样本时,这种不确定性量化的挑战加剧了。
-
研究动机与相关工作
基于分布无关的方法(例如符合性预测,conformal prediction),可以生成包含覆盖保证的预测集,即预测集保证以用户指定的概率(如95%)包含真实标签。本研究尝试评估该方法在AI辅助图像标注任务中的有效性,以及与传统top-k预测展示形式的比较。
解决方案
-
作者提出了哪些方法或解决方案? 本研究通过进行大规模在线实验,比较了符合性预测集(用于量化预测模型的不确定性)的效用与top-1和top-k预测显示的效用。
-
该解决方案的创新之处是什么?
- 提出了利用"Regularized Adaptive Prediction Sets (RAPS)"算法生成预测集,该算法以尽量小的集合实现期望的覆盖率。
- 系统性探讨了预测集在不同任务难度(易/难)及数据类型(分布内/in-distribution vs 分布外/OOD)的效果,评估模型预测在复杂场景中的表现。
-
实施步骤是什么?使用了哪些关键技术?
- 生成实验图像样本,通过ILSVRC 2012训练集选定分布内样本,并通过合成图像扰动生成分布外样本。
- 设计实验条件:无预测显示(baseline)、top-1预测显示、top-10预测显示、RAPS预测集。
- 实验任务:600名参与者随机分组,对16张图像进行标注,记录准确率、最短路径长度(表示标注错误与真实标签的距离)以及参与者自愿支付金额等指标。
- 分析采用贝叶斯线性混合效应模型,控制实验变量,评估实验结果。
研究成果
-
取得了哪些具体成果?
- 分布内场景下,较小的预测集能显著提高标注准确性;分布外场景下,无论预测集大小,RAPS均展现出更优性能。
- 实验证明,当预测模型较准确且分布内实例较易标注时,显示预测集对任务性能有辅助效果;但过多的预测信息可能增加认知负担,降低准确率。
- 对难的分布外实例,尽管预测集包含多个标签,参与者更依赖预测集,且提交的标签往往更接近正确答案。
-
与现有解决方案相比,它有哪些优势? 符合性预测集提供了比传统top-k方法更具适应性且具有覆盖保证的预测,特别是在分布外样本上,显著提高了人类决策的准确性。
-
实验或评估结果是什么?
- 分布内易例子:RAPS较小集提升准确率,平均标注准确率为74.2%,明显高于top-10和top-1。
- 分布外困难例子:RAPS预测集表现最好,复杂情况下基于大型预测集响应标签更接近真实答案。
- “愿意支付金额”(willingness-to-pay)实验提供了参与者对显示效果感知价值的经济指标,但RAPS价值普遍被低估。
-
局限性与未来方向
- 实验未探索预测集覆盖率下降对参与者判断的影响,需要进一步研究不同覆盖水平对学习表现的影响。
- 在真实世界的建模中,适应性预测集可能面临意图干扰(例如对抗攻击),这一问题尚待解决。
- 在实验设计中,"愿意支付金额"评估难以量化与个体绩效更紧密的联系。未来计划扩展设计,以探究用户对预测显示的真正理解与偏好。
总结
本文通过大规模实验验证了通过符合性预测集量化不确定性在AI辅助决策场景中的效用。对于分布外样本,特别困难实例,RAPS预测集相比传统展示效果更佳。研究揭示了在深度学习模型实际应用场景中利用预测集的广泛潜力,同时指出了设计预测显示的关键注意点,例如预测集大小与用户认知负担的平衡。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 在AI辅助图像标注中,符合预测的预测集合(conformal prediction sets)相比传统的top-1和top-k预测显示效果如何?分类: XAI 解释与适当依赖校准同类问题arrow_forward
- “正则化自适应预测集合”(RAPS)如何在不同任务难度和数据类型场景中表现?分类: XAI 解释与适当依赖校准同类问题arrow_forward
- 预测集合的大小和覆盖率对用户准确性和认知负担有什么影响?分类: XAI 解释与适当依赖校准同类问题arrow_forward
现实痛点
1- AI模型给出过度自信预测,用户难以信任结果或做出准确决策。分类: XAI 解释与适当依赖校准同类问题arrow_forward
- 83%
改进模型不可知的可解释人工智能工具中的特征贡献的可理解性
CHI '22· 可解释人工智能(XAI) +1
- 83%
Orbit:多目标排序器设计与评估框架
IUI '25· 可解释人工智能(XAI) +1
- 71%
辅助接口的决策论表示
CHI '26· AI 辅助决策与自动化系统 +2
- 71%
🌳-generAItor:用于语言模型可解释性与适配的树内循环文本生成
IUI '25· 可解释人工智能(XAI) +2
- 67%
使用用户模拟识别对话推荐系统中的交互崩溃
CUI '24· 可解释人工智能(XAI) +1
- 63%
协作解释情境下的决策策略差异:两项联合研究
IUI '19· 眼动追踪与注视交互 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)