展示,而不是讲述:设计声音感知系统的人工智能与人类协作方法
电肌肉刺激(EMS)控制语音用户界面(VUI)设计听觉障碍者支持(字幕、手语、振动)语言治疗师与听觉学家辅助技术专家
文献标题
A Human-AI Collaborative Approach for Designing Sound Awareness Systems
文献信息
- 主题领域: 人工智能、人机交互、声音识别、辅助技术
- 关键词: 人工智能协作, 声音分类, 聋人文化, 声音感知, 无障碍设计, 美国手语 (ASL), 声音识别, 辅助技术, DHH用户体验, 声音处理
研究背景与问题
- 问题或挑战: 现有的声音识别系统(例如 SoundWatch)无法区分物理特性相似的声音(如微波炉与心率监测器的报警声),且常常由于缺乏情境信息而识别错误。此外,这些系统难以适应复杂的声音状态(如门敲门与门猛关)。
- 重要性: 提供可靠的声音感知系统对于聋人和听力损失者(DHH用户)来说是至关重要的,可以帮助他们更好地感知日常声音并提高生活质量。
- 研究动机与相关工作:
- 当前的声音分类主要基于听觉感知,不适应DHH用户的需求。
- 声音分类方法包括基于声源、交互性、信号特性和混合特性的方法,但缺乏从DHH用户视角设计的分类方法。
- 当前系统在无障碍设计方面仍有局限性,需要结合DHH用户的语境知识来提高声音分类准确性。
解决方案
- 提出的方法或解决方案: 作者提出了一个创新的“人类-人工智能协作声音感知系统”(HACS)。该系统结合人工智能的声音特性识别能力和DHH用户的情境理解能力,实现更加准确的声音事件识别。
- 创新之处: HACS迫使AI专注于识别声音的“特性”(例如“滴答声”或“液体流动声”),而非传统的声源或声音事件。用户根据这些声音特性以及实时情境信息,得出声音事件(例如厨房里的微波炉正在工作)。
- 实施步骤与关键技术:
- 声音识别模型提取环境中的音频信号并分析其特性。
- 系统将声音特性信息传达给DHH用户。
- 用户根据声音特性和情境信息对声音事件进行判断。
- 设计了一个18类基于ASL的声音分类表,分类基于声音特性(如“液体流动”、“机器嗡嗡声”等),并通过人工智能与听障用户合作验证该分类表。
研究成果
- 具体成果:
- 提出了一个创新的人机协作框架(HACS)用于设计声音感知系统。
- 构建了一个由18个声音类别组成的分类系统,基于声音特性和ASL的视觉空间表达方式。
- 通过两项初步评估验证了HACS在帮助用户识别声音事件方面的潜力:
- 模拟评估:通过实际测试,DHH用户能够根据独立声音特性和情境信息正确推断声音事件。
- 算法评估:基于分类表训练AI模型,在小型数据集上的分类准确率达到了98.6%。
- 优势:
- 提高了识别精度,解决了传统声音事件识别系统难以区分相似声音的问题。
- 增加了DHH用户在声音处理中的自主性。
- 自定义性强,允许根据上下文或个人习惯调整声音类。
- 实验或评估结果:
- 在PE1中,测试对象可以将声音类别适配到不同情境中的具体声音事件。
- 在PE2中,AI模型对分类表中的声音类别达到了几乎完全正确的算法识别性能。
- 局限性与未来方向:
- 目前的分类表可能缺乏全覆盖性,例如未包含音乐或旋律类声音。
- 对重叠或同时发生声音的处理机制需要进一步研究。
- 系统可能需要扩展至其他手语系统(如印巴手语、中文手语)以满足更广泛用户需求。
- 需探索用户体验的长期验证,确保HACS系统能够在多样化的环境中有效运行。
该研究为声音感知领域带来了深远的突破,通过结合人工智能和用户能力,开创了新的无障碍设计方式,同时提升了人工智能辅助系统的可用性与包容性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 现有声觉识别系统为何难以准确区分物理属性相似的声音?分类: 物理环境感知与日常测量方法同类问题arrow_forward
- 如何通过结合DHH用户的语境知识与AI技术改进声音分类?分类: 听障沟通与手语识别同类问题arrow_forward
- 基于声学特性而非声音来源的分类方法是否能更好服务听障用户?分类: 听障沟通与手语识别同类问题arrow_forward
lightbulb
现实痛点
1- 听障人士难以准确获知如报警器等日常重要声音。分类: 听障沟通与手语识别同类问题arrow_forward
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642062
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
电肌肉刺激(EMS)控制、语音用户界面(VUI)设计、听觉障碍者支持(字幕、手语、振动)
work
职业/产业
语言治疗师与听觉学家、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文