文献标题

ReHEarSSE: Recognizing Hidden-in-the-Ear Silently Spelled Expressions

文献信息

  • 主题领域: 声音传感、人工智能、人机交互 (HCI)
  • 关键词: 静态语音交互,文本输入,自回归模型,耳机计算,声学感知

研究背景与问题

  • 发现的问题或挑战:
    1. 传统的静态语音交互(SSI)系统通常依赖定制硬件,仅支持小词汇表或指定指令,难以满足更广泛的应用场景。
    2. 由光学、声学或运动信号驱动的SSI系统存在设备侵入性、隐私问题、噪声干扰等限制。
    3. 即使在SSI中使用超声传感,先前工作也未成功扩展超过32-50个单词的词汇表范围。
  • 重要性:
    1. SSI可用于安静环境的隐私输入,避免语音干扰。
    2. 为无法发声(如喉部分割患者)或无法使用手动输入的人群提供交互支持。
  • 动机与相关工作:
    • 作者认为耳机中的主动降噪部件可以通过超声波反射捕获耳道动态运动(ECDM),潜在地用于大词汇表的SSI。
    • 现有超声SSI如EarCommand仅限定制硬件,研究尚未证明这类系统能支持大规模词汇表或未见单词。

解决方案

  • 提出的方法或解决方案:
    1. 开发名为ReHEarSSE的SSI系统,基于商用耳机的超声传感技术。
    2. 使用自回归(AR)特征代替传统的傅里叶变换特征,捕获耳道微小变化。
    3. 通过**时序卷积网络(TCN)**和CTC(时序连接分类)损失函数,构建可推断未见词汇的深度学习模型。
  • 创新之处:
    1. 支持包含最多1000单词的词汇表,且能够推断训练集中未出现的单词(即词汇泛化能力)。
    2. 使用优化的正交频分复用(OFDM)信号以提升超声波信号的分辨率和信息容量。
    3. 提出了非侵入式耳机超声传感系统,兼具隐私性和便捷性。
  • 实施步骤及关键技术:
    1. 信号设计: 使用优化的OFDM信号代替传统的FMCW信号,克服传统信号的峰均功率比(PAPR)问题。
    2. 特征提取: 提取AR特征,通过偏自相关函数(PACF)确定最佳自回归阶数。
    3. 推理阶段: 基于TCN网络学习字母的嵌入特征,通过CTC损失优化整个词预测,并使用排序得分实现词的自动匹配。

研究成果

  • 具体成果:
    1. 泛化能力:
      • 在100个未见单词的词汇表中,推断准确率达89.3%。
      • 在更大的词汇表(比如1000个单词,其中700未见)的情况下,准确率达73.3%。
    2. 与现有解决方案的比较:
      • 与EarCommand相比,扩展了词汇表规模、支持未见单词推断,并使用商用耳机实现。
      • 采用OFDM信号在目标词汇规模较大时优于FMCW信号,表现更鲁棒。
    3. 实验展示了该系统在背景噪声干扰、耳机重新佩戴及用户动作情况下的稳定性。
  • 实验或评估结果:
    • 在多个实验场景(如固定状态下、步行中、不同方向头部运动)下,系统表现鲁棒,平均准确率保持在70%-80%之间。
    • 用户的少量个性化数据(如约3-5分钟录制数据,涵盖120个单词)显著提升模型的词推断能力。
  • 局限性与未来方向:
    1. 初始模型需要一定数量的用户训练数据(如120个单词),对新用户上手稍有门槛。
    2. 系统尚未进行实时实现,后续需优化运算效率以适配耳机的边缘设备。
    3. 提升对背景运动(如步行、头部位移)的鲁棒性。
    4. 双耳协作(双耳音频输入)可能进一步增强系统性能,有待未来探索。

总结

ReHEarSSE通过利用商用耳机的超声传感实现非侵入性、超大词汇表支持的静态语音输入,被证明是静音语音交互领域的一项显著进展,它兼具隐私性、高泛化能力及可用性,面向多样化的商业/医疗应用场景具有潜力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147342/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642095
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
电肌肉刺激(EMS)控制、增强与替代通信(AAC)
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文