分歧去卷积:将机器学习性能指标与现实接轨
作者
可解释人工智能(XAI)算法透明度与可审计性软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
The Disagreement Deconvolution: Bringing Machine Learning Performance Metrics In Line With Reality
文献信息
- 主题领域: 人机交互与机器学习评价方法
- 关键词: 机器学习评价指标、社会计算、分类器性能、不一致处理、用户反馈、测试数据、噪声去除、多重标注、ROC AUC、预测准确性
研究背景与问题
-
作者发现的问题或挑战:
- 在注重用户交互的任务中(如评论毒性分类和假信息检测),机器学习分类器的技术指标(如ROC AUC)可能表现出高性能,但在实际使用中却效果不佳。
- 现有技术指标通常忽略了涉及人类意见分歧的数据的复杂性,导致评价结果过于乐观。
-
为什么这个问题很重要:
- 社会计算系统基于这些评价的结果来部署模型,但过于乐观的指标会导致错误决策,引发公众信任问题和功能不兼容问题。
-
研究动机与相关工作:
- 为解决人类意见分歧这一固有问题,现有研究探索了柔性标签和去噪模型,但仍缺乏针对真实世界用户体验的评价方法。
- 社会计算和人机交互领域尚未有一个标准化的指标来全面考虑标注分歧及其对模型性能的影响。
解决方案
-
提出的解决方案:
- 作者提出了一种新算法,称为分歧解卷积(Disagreement Deconvolution),用以重新定义机器学习任务的性能指标,将模型评价与现实中的用户反馈更加紧密地结合。
-
创新点:
- 基于多标注数据,算法估算标注者的主标签(主观分歧最小化后的稳定标签),而非单一聚合标签。
- 为分类器定义新的评价标准,不再比较预测值与“唯一真值”,而是比较预测值与每个标注者的主标签。
-
实施步骤与关键技术:
- 估计翻转概率 (pflip): 通过标注者的自我重复测试或矩阵分解(SVD)方法,推断标注是否反映其主要观点。
- 计算主标签分布: 使用pflip计算每个样本的标注主标签分布。
- 生成测试集: 从主标签分布中采样新的测试集,减少非主标签和噪声。
- 重新计算性能指标: 在新的测试集上运行标准度量(如ROC AUC、准确率等)。
研究成果
-
具体成果:
- 应用分歧解卷积后,社会计算任务(如朱格(Jigsaw)毒性检测)的实际性能从传统指标的0.95 ROC AUC大幅下降到0.73。
- 计算经典ML任务中,性能下降较轻(如CIFAR-10图像分类准确度从90.1%降至91.1%),验证了新方法对社会计算任务的适用性。
-
优势:
- 分析明确指出机器学习模型在真实世界中的性能上限。
- 自适应机制揭示了数据中固有分歧的真实影响,帮助团队更合理地设计和部署模型。
-
实验与评估结果:
- 对比标准聚合数据集,分歧解卷积有效提升了部分社会计算任务的真实模型性能评估结果(如去噪后Jigsaw任务从0.71 ROC AUC升至0.77)。
-
局限性与未来方向:
- 存在标注者的代表性问题:标注者可能无法真实反映模型的最终用户观点。
- 可能需要更多数据集属性(如测试重复标注)来提高方法的精度。
- 未来可以探索适应个别标注者的主标签权重定制和错误代价权重优化。
此研究为社会计算和人机交互领域提供了面向人类复杂反馈的新评价方法,具有重要实践意义。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 在包含人类意见分歧的数据中,如何有效评估机器学习模型的实际性能?分类: 人机协同标注与示例选择同类问题arrow_forward
- 基于多重标注数据,如何减少模型评价中的噪音和主观分歧?分类: 人机协同标注与示例选择同类问题arrow_forward
- 现有机器学习性能指标是否能准确反映模型在实际社交计算任务中的表现?分类: 人机协同标注与示例选择同类问题arrow_forward
lightbulb
现实痛点
1- 社交计算任务中,机器学习模型常因忽略人类分歧导致表现评估过于乐观。分类: 人机协同标注与示例选择同类问题arrow_forward
- 83%
通过交互重建评估生成模型的可解释性
CHI '21· 可解释人工智能(XAI) +2
- 83%
解开AI错误的困境:探索人类和机器解释对大型语言模型的有效性
CHI '24· 大语言模型(LLM)的人机协作 +2
- 80%
操纵和测量模型可解释性
CHI '21· 可解释人工智能(XAI) +1
- 80%
共享兴趣:测量人机对齐以识别模型行为中的重复模式
CHI '22· 可解释人工智能(XAI) +1
- 80%
去偏CAM以减轻图像扰动并提供机器学习的忠实可视化解释
CHI '22· 可解释人工智能(XAI) +1
- 80%
渐进披露:设计有效透明性的实证方法
IUI '19· 可解释人工智能(XAI) +1
- 80%
当人类与算法相遇:智能日常应用中用户报告的问题
IUI '19· 可解释人工智能(XAI) +1
- 71%
推荐算法的现场测试:理解多臂强盗中对人类偏好的假设的有效性
CHI '23· 可解释人工智能(XAI) +2
- 71%
应对不确定性:生成式AI开发者在开源平台上如何记录他们的模型
CHI '26· 可解释人工智能(XAI) +3
- 67%
解释作为支持算法透明度的机制
CHI '18· 可解释人工智能(XAI) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445423
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
可解释人工智能(XAI)、算法透明度与可审计性
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文