SEMOUR: 乌尔都语情感语音脚本库

多语言与跨文化语音交互会话代理的人格与拟人化语音可访问性AI/ML 研究员与工程师HCI 研究员认知科学家

文献标题

SEMOUR: A Scripted Emotional Speech Repository for Urdu

文献信息

  • 主题领域: 情感语音识别数据集和深度学习
  • 关键词: 情感语音, 语音数据集, 数字录音, 语音情感识别, 乌尔都语, 人类标注, 机器学习, 深度学习

研究背景与问题

  • 发现的问题或挑战:

    • 当前的语音情感识别(SER)数据集主要集中于少数几种语言(如英语、德语和意大利语),尚未在广泛使用的乌尔都语中开发全面的数据集。
    • 乌尔都语是世界上第十一大语言(约1.71亿人使用),但缺乏支持情感识别的高质量语音数据。
    • 现有的乌尔都语情感数据集较小(400条数据)且情感类别有限,无法满足面向复杂情感分析或机器学习模型的需求。
  • 重要性:

    • 开发乌尔都语情感语音识别系统对于健康诊断(心理障碍检测)、公众情绪反馈分析及社会公平性研究具有重要意义。
    • 提供大型、标注良好的情感语音数据集有助于提升情感识别系统的准确性,扩大其应用范围。
  • 研究动机与相关工作:

    • 此前的工作表明,主流语言的情感语音识别系统受益于深度学习技术,例如IEMOCAP(英语)和Emo-DB(德语)数据库。这些系统依赖大量高质量标注数据,缺乏此类数据会限制模型训练与泛化能力。
    • 乌尔都语亟需一个音素和性别平衡的情感语音数据集,以满足模型在这一语言中的训练与应用需求。

解决方案

  • 提出的方法或解决方案:

    • 构建了首个针对乌尔都语的情感语音数据集SEMOUR,覆盖8种情感(如快乐、悲伤、惊讶等),包含15,040条高质量语音实例。
    • 数据通过专业演员在隔音室中录制,内容均为平衡的音素构成,且在标注中利用人类标签提供高一致性评估。
    • 提出了一种基于深度神经网络(DNN)的情感识别模型,记录了对数据集的基准实验结果。
  • 创新之处:

    • 数据集均衡分布了乌尔都语的音素、语法复杂性及性别构成,确保模型的泛化能力。
    • 与以往仅包含自然情绪或内容单一的语料库不同,SEMOUR使用的是脚本化且人工标注的高质量情感语音实例。
    • 模型使用多种语音特征(MFCC、Chroma、Mel谱图)训练,达到了92%的情感识别准确率。
  • 实施步骤与关键技术:

    1. 脚本设计: 从两大数据源(高频词集合和词典)提取67种乌尔都语音素,设计出包含235个语音实例的多样化剧本。
    2. 语音录制: 聘请专业演员在隔音录音棚按8类情感配音,涵盖性别平衡。
    3. 数据处理: 对录制文件进行降噪、分段和标准化处理。
    4. 人类标注: 选择5000条语音由16位专家进行打分评估,以确保情感标签的一致性。
    5. 特征提取与建模: 采用Librosa库提取MFCC、Chroma、Mel谱图特征;用DNN训练分类模型。

研究成果

  • 具体成果:

    • SEMOUR数据集成功覆盖了超15,000条实例,每条语音平均1.657秒。
    • 建立的DNN模型对语音情感识别任务达到了92%的准确率,大幅领先传统机器学习模型(如SVM或随机森林)。
  • 与现有解决方案的比较:

    • SEMOUR显著扩展了乌尔都语领域的情感语音数据,而此前的最大乌尔都语数据集仅有400条语音实例。
    • 相比传统特征和分类方法,深度学习方法表现出更高的准确率与灵活性。
  • 实验或评估结果:

    • 通过10折交叉验证,模型在随机测试集上的平均准确率为90%。
    • 性别分析中,男女演员分别单独训练后的模型准确率高达96%和92%,但在跨性别测试中下降。
    • 对于未知说话者(Leave-One-Out实验)准确率减至39%,表明说话者个性化对模型有显著影响。
  • 局限性与未来方向:

    1. 局限性:
      • 缺乏自然情感语音的泛化能力:SEMOUR数据主要基于脚本表演,无法准确模拟自然情感语音的复杂性。
      • 语言和方言代表性不足:当前数据只涉及一种乌尔都语方言(拉合尔口音)。
      • 未能探索更复杂的深度学习模型(如LSTM或Transformer)以解决未知说话人的语义多样性。
    2. 未来方向:
      • 扩展数据集以涵盖所有乌尔都语主要方言和口音。
      • 收集自然情感语音数据,多方验证模型的泛化能力。
      • 测试更先进的模型架构以改善未知说话者上的分类性能。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/47362/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445171
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
多语言与跨文化语音交互、会话代理的人格与拟人化、语音可访问性
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、认知科学家
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文