SEMOUR: 乌尔都语情感语音脚本库
作者
多语言与跨文化语音交互会话代理的人格与拟人化语音可访问性AI/ML 研究员与工程师HCI 研究员认知科学家
文献标题
SEMOUR: A Scripted Emotional Speech Repository for Urdu
文献信息
- 主题领域: 情感语音识别数据集和深度学习
- 关键词: 情感语音, 语音数据集, 数字录音, 语音情感识别, 乌尔都语, 人类标注, 机器学习, 深度学习
研究背景与问题
-
发现的问题或挑战:
- 当前的语音情感识别(SER)数据集主要集中于少数几种语言(如英语、德语和意大利语),尚未在广泛使用的乌尔都语中开发全面的数据集。
- 乌尔都语是世界上第十一大语言(约1.71亿人使用),但缺乏支持情感识别的高质量语音数据。
- 现有的乌尔都语情感数据集较小(400条数据)且情感类别有限,无法满足面向复杂情感分析或机器学习模型的需求。
-
重要性:
- 开发乌尔都语情感语音识别系统对于健康诊断(心理障碍检测)、公众情绪反馈分析及社会公平性研究具有重要意义。
- 提供大型、标注良好的情感语音数据集有助于提升情感识别系统的准确性,扩大其应用范围。
-
研究动机与相关工作:
- 此前的工作表明,主流语言的情感语音识别系统受益于深度学习技术,例如IEMOCAP(英语)和Emo-DB(德语)数据库。这些系统依赖大量高质量标注数据,缺乏此类数据会限制模型训练与泛化能力。
- 乌尔都语亟需一个音素和性别平衡的情感语音数据集,以满足模型在这一语言中的训练与应用需求。
解决方案
-
提出的方法或解决方案:
- 构建了首个针对乌尔都语的情感语音数据集SEMOUR,覆盖8种情感(如快乐、悲伤、惊讶等),包含15,040条高质量语音实例。
- 数据通过专业演员在隔音室中录制,内容均为平衡的音素构成,且在标注中利用人类标签提供高一致性评估。
- 提出了一种基于深度神经网络(DNN)的情感识别模型,记录了对数据集的基准实验结果。
-
创新之处:
- 数据集均衡分布了乌尔都语的音素、语法复杂性及性别构成,确保模型的泛化能力。
- 与以往仅包含自然情绪或内容单一的语料库不同,SEMOUR使用的是脚本化且人工标注的高质量情感语音实例。
- 模型使用多种语音特征(MFCC、Chroma、Mel谱图)训练,达到了92%的情感识别准确率。
-
实施步骤与关键技术:
- 脚本设计: 从两大数据源(高频词集合和词典)提取67种乌尔都语音素,设计出包含235个语音实例的多样化剧本。
- 语音录制: 聘请专业演员在隔音录音棚按8类情感配音,涵盖性别平衡。
- 数据处理: 对录制文件进行降噪、分段和标准化处理。
- 人类标注: 选择5000条语音由16位专家进行打分评估,以确保情感标签的一致性。
- 特征提取与建模: 采用Librosa库提取MFCC、Chroma、Mel谱图特征;用DNN训练分类模型。
研究成果
-
具体成果:
- SEMOUR数据集成功覆盖了超15,000条实例,每条语音平均1.657秒。
- 建立的DNN模型对语音情感识别任务达到了92%的准确率,大幅领先传统机器学习模型(如SVM或随机森林)。
-
与现有解决方案的比较:
- SEMOUR显著扩展了乌尔都语领域的情感语音数据,而此前的最大乌尔都语数据集仅有400条语音实例。
- 相比传统特征和分类方法,深度学习方法表现出更高的准确率与灵活性。
-
实验或评估结果:
- 通过10折交叉验证,模型在随机测试集上的平均准确率为90%。
- 性别分析中,男女演员分别单独训练后的模型准确率高达96%和92%,但在跨性别测试中下降。
- 对于未知说话者(Leave-One-Out实验)准确率减至39%,表明说话者个性化对模型有显著影响。
-
局限性与未来方向:
- 局限性:
- 缺乏自然情感语音的泛化能力:SEMOUR数据主要基于脚本表演,无法准确模拟自然情感语音的复杂性。
- 语言和方言代表性不足:当前数据只涉及一种乌尔都语方言(拉合尔口音)。
- 未能探索更复杂的深度学习模型(如LSTM或Transformer)以解决未知说话人的语义多样性。
- 未来方向:
- 扩展数据集以涵盖所有乌尔都语主要方言和口音。
- 收集自然情感语音数据,多方验证模型的泛化能力。
- 测试更先进的模型架构以改善未知说话者上的分类性能。
- 局限性:
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 创建一个高质量的乌尔都语情感语音数据集是否能够推动情感识别系统的发展?分类: 社会感知、情绪理解与意图推断方法同类问题arrow_forward
- 哪种特征和模型方法最适合提高乌尔都语情感识别的准确性?分类: 社会感知、情绪理解与意图推断方法同类问题arrow_forward
- 剧本化的情感语音能多大程度上代表自然情感语音的复杂性?分类: 社会感知、情绪理解与意图推断方法同类问题arrow_forward
lightbulb
现实痛点
1- 乌尔都语用户缺乏用于情感识别的优质语音数据。分类: 社会感知、情绪理解与意图推断方法同类问题arrow_forward
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445171
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
多语言与跨文化语音交互、会话代理的人格与拟人化、语音可访问性
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、认知科学家
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文