感觉有多准确? - 人类对不同类型分类错误的感知
作者
可解释人工智能(XAI)可视化感知与认知HCI 研究员认知科学家
文献标题
How Accurate Does It Feel? – Human Perception of Different Types of Classification Mistakes
文献信息
- 主题领域: 人机交互 (HCI) 与机器学习系统的用户感知评价
- 关键词: 准确性, 用户感知, 标注噪音, 分类错误, 数据质量, 用户研究
研究背景与问题
-
发现的问题或挑战:
- 监督学习系统通常基于带有“真值”标签的训练集,但这些标签可能存在错误或人为主观性的噪音。
- 系统在数据中的分类错误可能与用户的感知体验存在偏差,导致传统的准确性指标难以真实反映用户体验。
- 数据中的标签错误或模糊性可能显著影响人类对算法的信任与接受程度。
-
重要性:
- 准确评估机器学习系统性能对于提升用户信任、优化用户体验乃至避免社会性错误(如偏见)的影响至关重要。
- 数据分类的困难性与预测错误对用户感知的影响尚未深入研究,有助于改进模型评估的标准。
-
研究动机与相关工作:
- 以往研究表明,用户在观察到分类错误后可能对系统产生不信任,甚至忽略其建议。
- 传统指标如准确率、精确率和召回率无法捕捉用户对系统性能的主观感知。
- 本研究聚焦于用户如何感知不同分类困难度的错误,并提供人类中心视角的系统评价方法。
解决方案
-
提出的方案或方法:
- 使用人为设计的分类器,构建实验条件来模拟不同分类错误类型(如易分类、困难分类和不可能分类)。
- 收集用户对分类器性能的主观感知评价,并与传统指标(如准确率、F1分数)进行对比。
-
创新之处:
- 将用户感知的不确定性引入系统评价指标,提出“感知准确性”的概念,研究分类困难度对用户感知的影响。
- 明确指出传统机器学习性能评价与用户感知间的差距,建议考虑分类困难性在人机交互任务中的作用。
-
实施步骤与关键技术:
- 数据构建:
- 通过众包任务,将二分类数据集中的句子标注为两类:易于分类、困难分类、不可能分类。
- 用于实验的两个数据集分别包含易分类的数据和混合分类的数据。
- 实验设计:
- 制造用于模拟的多个“分类器”,分别具有不同错误分布(在易分类、困难分类和不可能分类的句子上)。
- 实验参与者与分类器交互,以主观评价其表现(“感知准确性”)。
- 评价方法:
- 评估用户与分类器的“计算准确性”(传统指标)与“感知准确性”之间的差异。
- 使用统计测试检验各实验条件下分类错误对用户感知的显著性影响。
- 数据构建:
研究成果
-
具体成果:
- 分类器在易于分类数据上的错误会导致用户显著低估其性能(较低感知准确性)。
- 在困难分类和不可能分类数据上的错误对用户感知的影响较小,甚至可能存在系统性能的过度高估。
- 数据集中的分类困难性本身也会降低用户对100%正确分类器的感知准确性。
-
相对优势:
- 与传统准确性指标相比,通过分析用户感知准确性,可以更深入地揭示用户与机器学习模型之间的交互机制。
- 实验结果支持引入新的评价方法,这些方法比单纯计算指标更能够反映用户视角下的系统表现。
-
实验或评估结果:
- 面向不同错误类型的分类器实现了跨条件的用户主观评价显著差异,证实了感知准确性与分类错误类别之间存在关联。
- 对传统指标(如精确率、F1分数)的检验表明,其在反映用户感知时存在系统性偏差。
-
局限性与未来方向:
- 局限性:
- 实验强制参与者对每个分类任务做出二元判断,可能限制了对真实世界场景的模拟。
- 数据集和任务类型的单一性(仅涉及文本分类任务)可能限制了研究结果的通用性。
- 未来方向:
- 扩展到涉及复杂数据类型(如图像和音频)的机器学习任务。
- 考虑非二元用户选择以探索更细粒度的感知评价。
- 探索不同交互场景与任务设置对用户感知准确性的影响。
- 局限性:
研究表明,仅用传统准确性指标评价机器学习系统难以反映用户视角的系统性能,强调了从人类感知角度构建新的评价标准的必要性,尤其是在考虑分类困难性的场景下。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 用户如何感知不同类型的分类错误对系统准确性的影响?分类: 指标理解与分析解释支持同类问题arrow_forward
- 分类任务的难度如何影响用户对系统性能的主观评价?分类: 指标理解与分析解释支持同类问题arrow_forward
- 传统准确性指标为何无法充分反映用户感知的分类性能?分类: 指标理解与分析解释支持同类问题arrow_forward
lightbulb
现实痛点
1- 用户常因看到分类错误而失去对机器学习系统的信任。分类: 算法厌恶、用户控制与信任校准同类问题arrow_forward
- 80%
面向星际争霸智能体理解的信息寻食研究:一项实证研究
IUI '18· 可解释人工智能(XAI) +2
- 75%
COGAM:在机器学习模型解释中测量和调节认知负荷
CHI '20· 可解释人工智能(XAI)
- 75%
像素之间的阅读:探究可视化素养的障碍
CHI '24· 可视化感知与认知
- 75%
你误点击了吗?反转5点满意度量表导致意外反应
CHI '24· 可视化感知与认知
- 60%
TopoText:跨多个空间尺度保持上下文的文本数据探索
CHI '18· 交互式数据可视化 +1
- 60%
我们如何衡量这一点?! 快速量表开发
CHI '18· 可视化感知与认知 +1
- 60%
BubbleView:一个用于众包图像重要性映射和跟踪视觉注意力的界面
CHI '18· 眼动追踪与注视交互 +1
- 60%
理解数字中介的同理心:对视觉、叙事和生物感官信息线索的探索
CHI '19· 可视化感知与认知 +1
- 60%
瞳孔活动的低/高指数
CHI '20· 眼动追踪与注视交互 +1
- 60%
希克定律对人机交互有多重要?
CHI '20· 可视化感知与认知 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3501915
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
可解释人工智能(XAI)、可视化感知与认知
work
职业/产业
HCI 研究员、认知科学家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文