为21世纪创建包容性声音:面向对话助手的非二元文本转语音技术

多语言与跨文化语音交互会话代理的人格与拟人化

文献标题

创建面向 21 世纪的包容性声音:一种非二元文本到语音技术,用于对话助手开发

文献信息

  • 主题领域: 人机交互、语音生成技术、非二元性别包容性
  • 关键词: 性别, 文本到语音 (TTS), 语音助手, 语音用户界面, 人机交互设计, 包容性技术, LGBTQ+, 非二元声音, 性别归属, 语音合成

研究背景与问题

  • 发现的问题或挑战:

    1. 当前多数语音助手(如 Siri 和 Alexa)的默认声音为女性,或者仅提供传统的男性或女性语音选项,这种性别二分的设计强化了性别刻板印象和消极行为(如性骚扰或仇视性别)。
    2. 非二元或性别模糊语音的缺乏导致非二元群体的代表性不足。
    3. 现有研究表明听众对模糊性别语音的接受度较低,认为其“不可信、不友好”,但这些研究可能不再适用于现代社会的多元性别文化。
  • 重要性: 随着语音助手在人类日常生活中的应用越来越广泛,不包容的设计可能会损害边缘化群体的体验和作为用户的归属感。此外,包容性的技术设计能够推动性别平等和多元文化的接受,从技术层面促进社会的进步。

  • 研究动机与相关工作:

    1. UNESCO 等机构指出,单一性别化语音助手可能强化“女性从属”的性别刻板印象。
    2. 以往的少数尝试(如 "Q" 的性别中性声音)仅停留在概念层面,缺乏实际的语音合成应用能力。
    3. 非二元和跨性别声音的呈现需要新的技术方法以匹配现实的多样性表达。

解决方案

  • 提出的解决方案:

    1. 开发了一种创建非二元文本到语音(TTS)的方法,结合了非二元和跨性别社区的反馈。
    2. 使用这项技术创建了一个名为 "Sam" 的示例语音,同时对生成过程和数据进行了开源共享以鼓励后续研究。
    3. 对不同性别身份用户对非二元语音助手的接受度和偏好进行了大规模的用户调研与对比分析。
  • 创新之处:

    1. 超越了仅通过调整语音基频(pitch)的简单技术,将语音特征扩展到语调、韵律、语音风格等多维度。
    2. 强调了与非二元和跨性别社区的合作,从语音设计到评估均融入了其需求和声音代表性。
    3. 开源了 TTS 模型、数据与流程,提供工具供他人开发更多自定义非二元语音选项,提升技术可持续性与社区参与度。
  • 实施步骤:

    1. 语音演员选择: 通过公开招募识别符合标准的语音演员,并邀请相关专家基于技术和非二元风格进行筛选。
    2. 语音数据制作: 使用标准的文本记录多小时的高质量语音数据,同时扩充样本库,使用非二元和跨性别社区提供的公开音频进行二次模型训练。
    3. 文本到语音模型开发: 采用两种 TTS 引擎(专有的 Neural TTS 和开源的 Idlak),通过迁移学习技术将训练后的特征模型调整至目标非二元范围。
    4. 反馈与迭代设计: 在非二元社区和规模化用户中进行两轮问卷调查,收集反馈并对生成的语音进行多次优化。
    5. 最终模型生成与调研: 确定最终语音轮廓,并进行大规模的用户调研,分析对不同性别语音的情感反应及适用性。

研究成果

  • 具体成果:

    1. 提出了一个包括语音合成方法和用户调研的综合流程,用于生成和评估非二元 TTS 声音。
    2. 设计了名为 "Sam" 的非二元语音,一个可直接应用于对话助手的声音选项。
    3. 完成了对 1010 名用户的大规模调查,发现非二元声音在偏好和信任度上对非二元个体更具吸引力,但对主流用户的接受度相对较低。
  • 相较现有方案的优势:

    1. 开源透明:不同于其他封闭性技术项目,所开发的数据与模型对外开放,鼓励开发者社区采用并改进。
    2. 专注细致: 通过多轮基于社区反馈的迭代,确保生成语音更加贴近非二元身份的多样化表达。
    3. 多维度融入: 不仅改变语音基频,还考虑语音中的韵律、语义选择和使用场景等细节。
  • 实验或评估结果:

    1. 大规模研究显示,非二元语音在特定用户群(如非二元和 LGBTQ+ 个体)中提高了声誉和适用性。
    2. 在一些场景中,非二元语音表现出了良好的智能感和信赖感。
    3. 不同年龄段和性别身份的用户对男性语音仍有普遍偏好,但非二元声音为部分群体提供了独特的吸引力。
  • 局限性与未来方向:

    1. 该研究仅针对美国英语,因此无法涵盖其他语言或方言的文化背景与语音习惯。
    2. 模型的开放可能存在对数据和语音的滥用风险;需持续关注其社会影响,并加强对数据正当用途的限制。
    3. 未来可以进一步扩展多语言环境、涵盖各种文化背景,并开发更多元的语音特征(如多语音重合或更多情感表达)。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/96187/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581281
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
多语言与跨文化语音交互、会话代理的人格与拟人化
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
7 篇相关论文