分歧去卷积:将机器学习性能指标与现实接轨

可解释人工智能(XAI)算法透明度与可审计性软件工程师与开发者AI/ML 研究员与工程师HCI 研究员

文献标题

The Disagreement Deconvolution: Bringing Machine Learning Performance Metrics In Line With Reality

文献信息

  • 主题领域: 人机交互与机器学习评价方法
  • 关键词: 机器学习评价指标、社会计算、分类器性能、不一致处理、用户反馈、测试数据、噪声去除、多重标注、ROC AUC、预测准确性

研究背景与问题

  • 作者发现的问题或挑战:

    • 在注重用户交互的任务中(如评论毒性分类和假信息检测),机器学习分类器的技术指标(如ROC AUC)可能表现出高性能,但在实际使用中却效果不佳。
    • 现有技术指标通常忽略了涉及人类意见分歧的数据的复杂性,导致评价结果过于乐观。
  • 为什么这个问题很重要:

    • 社会计算系统基于这些评价的结果来部署模型,但过于乐观的指标会导致错误决策,引发公众信任问题和功能不兼容问题。
  • 研究动机与相关工作:

    • 为解决人类意见分歧这一固有问题,现有研究探索了柔性标签和去噪模型,但仍缺乏针对真实世界用户体验的评价方法。
    • 社会计算和人机交互领域尚未有一个标准化的指标来全面考虑标注分歧及其对模型性能的影响。

解决方案

  • 提出的解决方案:

    • 作者提出了一种新算法,称为分歧解卷积(Disagreement Deconvolution),用以重新定义机器学习任务的性能指标,将模型评价与现实中的用户反馈更加紧密地结合。
  • 创新点:

    • 基于多标注数据,算法估算标注者的主标签(主观分歧最小化后的稳定标签),而非单一聚合标签。
    • 为分类器定义新的评价标准,不再比较预测值与“唯一真值”,而是比较预测值与每个标注者的主标签。
  • 实施步骤与关键技术:

    1. 估计翻转概率 (pflip): 通过标注者的自我重复测试或矩阵分解(SVD)方法,推断标注是否反映其主要观点。
    2. 计算主标签分布: 使用pflip计算每个样本的标注主标签分布。
    3. 生成测试集: 从主标签分布中采样新的测试集,减少非主标签和噪声。
    4. 重新计算性能指标: 在新的测试集上运行标准度量(如ROC AUC、准确率等)。

研究成果

  • 具体成果:

    • 应用分歧解卷积后,社会计算任务(如朱格(Jigsaw)毒性检测)的实际性能从传统指标的0.95 ROC AUC大幅下降到0.73。
    • 计算经典ML任务中,性能下降较轻(如CIFAR-10图像分类准确度从90.1%降至91.1%),验证了新方法对社会计算任务的适用性。
  • 优势:

    • 分析明确指出机器学习模型在真实世界中的性能上限。
    • 自适应机制揭示了数据中固有分歧的真实影响,帮助团队更合理地设计和部署模型。
  • 实验与评估结果:

    • 对比标准聚合数据集,分歧解卷积有效提升了部分社会计算任务的真实模型性能评估结果(如去噪后Jigsaw任务从0.71 ROC AUC升至0.77)。
  • 局限性与未来方向:

    • 存在标注者的代表性问题:标注者可能无法真实反映模型的最终用户观点。
    • 可能需要更多数据集属性(如测试重复标注)来提高方法的精度。
    • 未来可以探索适应个别标注者的主标签权重定制和错误代价权重优化。

此研究为社会计算和人机交互领域提供了面向人类复杂反馈的新评价方法,具有重要实践意义。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/47184/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445423
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
可解释人工智能(XAI)、算法透明度与可审计性
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文