ProtoSound:为聋人和重听用户设计的个性化和可扩展的声音识别系统

听觉障碍者支持(字幕、手语、振动)运动障碍辅助输入技术语言治疗师与听觉学家残障服务提供者辅助技术专家

文献标题

ProtoSound: A Personalized and Scalable Sound Recognition System for Deaf and Hard-of-Hearing Users

文献信息

  • 主题领域: 人机交互与机器学习
  • 关键词: 可定制声音识别、少量样本学习、听障者技术、环境音识别、声音感知、手机应用

研究背景与问题

  • 作者发现了哪些问题或挑战?

    1. 当前的声音识别系统使用预训练的通用模型,这些模型无法满足听障用户的多样化需求。
    2. 现有系统缺乏对用户定制声音类别的支持,例如家庭专属声音(孩子的声音或宠物的吠叫)。
    3. 通用模型无法适应日常生活中音频环境的多样性,例如室内与室外背景的变换。
  • 为什么这个问题很重要?

    1. 声音识别系统能够为听障用户提供环境、活动和紧急情况的重要提示,有助于提高他们的生活质量和安全性。
    2. 个性化和环境适应能显著提高系统的准确性和用户满意度。
  • 研究动机与相关工作

    1. 作者基于以往的研究和472名听障参与者的问卷调查,明确了用户对个人声音识别技术的强需求。
    2. 作者详细分析了现有声音识别工具的局限性及其在真实场景中的不足。
    3. 受之前少样本学习研究的启发,作者提出了更用户友好的系统设计和实现。

解决方案

  • 作者提出了哪些方法或解决方案?

    1. ProtoSound系统:一种少样本学习模型,通过用户提供的少量样本定制声音类别。
    2. 实时个性化模型:通过少量音频记录即可实时地在移动设备上完成模型定制。
    3. 上下文泛化技术:引入数据增强方法,使模型能适应不同环境中的背景噪声。
    4. 开放类别识别:允许系统识别未知声音类别。
  • 该解决方案的创新之处是什么?

    1. 提出了首个可扩展且低用户参与成本的声音识别系统。
    2. 系统设计结合了少样本学习的技术特点,同时融入了个性化以及实时运行的需求。
    3. 支持处理难以记录的目标声音类别,通过内置在线资源库提高识别能力。
  • 实施步骤是什么?使用了哪些关键技术?

    1. 数据采集:用户录制用于模型训练的少量样本,每个类别大约需要5个样本。
    2. 模型训练:使用MobileNetV2架构进行特征提取,并通过原型网络生成类别原型。
    3. 预测阶段:比较测试音频与类别原型的距离,通过最近邻分类器完成声音类别预测。
    4. 增强功能:包括上下文泛化(通过背景噪声数据增强)、开放集分类(识别未知类别)以及实时端到端应用部署。

研究成果

  • 取得了哪些具体成果?

    1. 提出了ProtoSound系统,并通过Python开源代码和Android应用实现。
    2. 在两个真实世界数据集上进行实验,系统的准确率优于其他方法。
    3. 通过实地研究证明ProtoSound能够处理多样环境和个性化声音类别,其中用户平均录制时间为10分钟,预测准确率达87.4%。
  • 与现有解决方案相比,它有哪些优势?

    1. 实现少样本学习的实时部署,用户可在手机上训练模型,无需大量计算资源。
    2. 个性化支持,解决了通用模型无法处理用户专属声音的问题。
    3. 较高的准确率(+9.7%),优于当前少样本学习及传统监督学习方法。
  • 实验或评估结果是什么?

    1. 实验1:在听障参与者声音数据上,模型准确率达90.4%,显著高于监督学习基线模型。
    2. 实验2:在实际场景中检测到的声音中,准确率与人工标签接近(平均91.3%)。
    3. 实验3:田野研究表明,ProtoSound能够在多种位置(家中、餐厅、街道等)有效运行,用户反馈良好。
  • 局限性与未来方向

    1. 小类别支持:目前实验主要集中在5-way设置(5类别),未来可扩展至更多类别。
    2. 用户界面改进:需进一步优化用于声音录制和标注的界面,尤其针对听障用户。
    3. 长时间部署评估:目前的研究主要集中于短期评估,未来需进行长期研究以验证在多场景切换中的性能。
    4. 社会文化影响:需考虑听障用户群体的多样需求与文化偏好,包括对声音感知技术的接受程度。

开源资源与贡献

  1. Python和Android开源实现:https://github.com/makeabilitylab/ProtoSound
  2. 开放式声音库集成与用户交互设计。
  3. 提供了一套满足多场景研究需求的数据集及评估方法。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/68918/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3502020
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
10 位作者
sell
研究子方向
听觉障碍者支持(字幕、手语、振动)、运动障碍辅助输入技术
work
职业/产业
语言治疗师与听觉学家、残障服务提供者、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
6 篇相关论文