VibE:用于CVML模型子群体级语义错误分析的可视化分析工作流
作者
有效的错误分析对于CVML模型的成功开发和部署至关重要。理解模型错误的一种方法是总结错误样本的共同特征。在使用图像等非结构化复杂数据的任务中,这一点尤其具有挑战性,因为模式并不总是显而易见。另一种方法是分析预定义类别间的错误分布,但这需要分析师预先假设潜在错误原因。由于缺乏明确的标签或注释,形成这种假设很困难,分析师必须依赖人工检查、先验知识或直觉。这种缺乏结构化指导的情况会阻碍对模型失败位置的全面理解。为解决这些挑战,我们引入了VibE,一种语义错误分析工作流,旨在识别CVML模型在子群体层面的失败位置和原因,即使在标签或注释不可用的情况下。VibE包含几个核心功能以增强错误分析:语义子群体生成、语义汇总、候选问题建议、语义概念搜索和交互式子群体分析。通过利用大型基础模型(如CLIP和GPT-4)以及可视化分析,VibE使开发者能够语义化地解释和分析CVML模型错误。这个交互式工作流通过子群体发现帮助识别错误,通过自动生成的子群体摘要和建议问题支持假设生成,并通过语义概念搜索和比较分析支持假设验证。通过三个不同的CVML任务和深入的专家访谈,我们展示了VibE如何协助错误理解和分析。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 如何系统性地分析复杂计算机视觉和机器学习模型中的语义错误?分类: 大语言模型与生成式 AI 中的偏见与公平同类问题arrow_forward
- 如何通过多模态基础模型(例如CLIP和GPT-4)有效生成和总结语义子组?分类: 大语言模型与生成式 AI 中的偏见与公平同类问题arrow_forward
- 语义分析如何帮助提升模型训练的公平性和错误验证的效率?分类: 大语言模型与生成式 AI 中的偏见与公平同类问题arrow_forward
现实痛点
1- 用户难以高效发现和验证AI模型中的语义错误。分类: 大语言模型与生成式 AI 中的偏见与公平同类问题arrow_forward
- 80%
Graphologue:使用交互式图表探索大语言模型响应
UIST '23· 大语言模型(LLM)的人机协作 +1
- 67%
结晶体:降低开发者收集和组织决策信息的成本
CHI '22· 大语言模型(LLM)的人机协作 +2
- 67%
支持大规模语言模型输出的理解
CHI '24· 大语言模型(LLM)的人机协作 +2
- 67%
调试缺陷可视化:实证洞察助力人机协同调试系统设计
CHI '26· 交互式数据可视化 +2
- 67%
OntoScope:利用发散-收敛交互框架支持基于 LLM 的本体论范围界定
IUI '26· 大语言模型(LLM)的人机协作 +2
- 60%
从HCI研究中映射机器学习进展以揭示设计创新的起点
CHI '18· 大语言模型(LLM)的人机协作
- 60%
人类与AI交互中沟通方向性和AI代理差异的影响
CHI '21· 大语言模型(LLM)的人机协作 +1
- 60%
大规模可视化深度神经网络示例
CHI '21· 大语言模型(LLM)的人机协作 +1
- 60%
通过数据工作的工件追踪和可视化人与ML/AI的协作过程
CHI '23· 大语言模型(LLM)的人机协作 +1
- 60%
人工智能知识:通过人类赋能提升人工智能委托
CHI '23· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)