“适合情境的声音”:理解支持最终用户声音定制的需求和挑战

会话代理的人格与拟人化生成式AI(文本、图像、音乐、视频)

文献标题

“A Voice that Suits the Situation”: Understanding the Needs and Challenges for Supporting End-User Voice Customization

文献信息

  • 主题领域: 人机交互与声音定制技术
  • 关键词: 声音感知, 声音定制, 用户体验, 声音质量, 匿名互动, 虚拟世界

研究背景与问题

  • 作者发现了哪些问题或挑战?

    • 当前虚拟环境中的声音定制需求尚未得到充分满足,现有技术多集中于外观定制,而忽视了声音对用户评价和互动的影响。
    • 对现有声音定制工具的使用方式和需求存在数据和设计框架上的空白。
  • 为什么这个问题很重要?

    • 在社交距离增加和虚拟互动盛行的时代,声音与外观共同构成了虚拟世界中用户的身份表达,而声音定制可以增强用户体验,改善自我表征。
    • 声音定制在保护用户身份隐私和提升语言表达质量方面具有潜在价值,尤其适用于在线游戏和教育场景。
  • 研究动机与相关工作:

    • 元宇宙领域的研究已揭示用户对定制化虚拟外观的广泛需求,同时相关文献表明声音对人际互动中的评价和印象有强影响。
    • 声音定制可实现个性化表达,同时保护隐私,但现有技术主要集中在基于滤音的简单修改,而未能提供全面的声音塑造方式。

解决方案

  • 作者提出了哪些方法或解决方案?

    • 通过在线问卷调查和半结构化访谈研究了用户在不同场景下的声音偏好和定制需求。
    • 开发了一个基于Web的声音定制原型,支持用户搜索和选择目标声音。
  • 该解决方案的创新之处是什么?

    • 考察了具体场景中用户对声音表达的不同需求。
    • 提供了多维度的声音属性选择功能,包括气息感、光滑度、沙哑感和变化程度等,帮助用户找到适合的声音。
  • 实施步骤是什么?使用了哪些关键技术?

    1. 线上问卷研究: 调查声音定制需求和声音满意度,收集用户对不同场景的声音定制偏好。
    2. 原型开发与访谈:
      • 开发了一个基于Django框架的Web应用原型,用于声音搜索和筛选。
      • 使用了语音数据集(Speech Accent Archive)并采用Amazon Mechanical Turk标注声音属性。
      • 通过访谈收集用户选择依据和对声音定制系统的反馈。

研究成果

  • 取得了哪些具体成果?

    • 用户对声音定制有强烈需求,尤其是在线沟通场景中。
    • 用户倾向于根据互动的场景选择不同的声音风格,例如偏好匿名性或提高表达质量。
    • 提出了适用于声音定制工具的设计建议,包括支持多种声音属性、多级选项、基于上下文的配置文件等。
  • 与现有解决方案相比,它有哪些优势?

    • 作者的研究揭示了具体场景中声音定制的需求细节,如在游戏中隐藏性别、在工作中寻求专业声音表达。
    • 其原型提供了比传统滤音工具更丰富的功能,且用户能够审听并选择具体声音样本。
  • 实验或评估结果是什么?

    • 超过80%的问卷参与者表示在至少一种场景中希望改变自己的声音。
    • 具有匿名互动需求的场景(如在线游戏和客服场景)对声音定制需求最高。
    • 半结构化访谈进一步确认了用户在不同场景下对声音定制的具体属性需求,例如模块化声音变化以保持语音识别性。
  • 局限性与未来方向

    • 局限性:

      • 数据主要来自韩国用户,可能不适用于其他文化背景。
      • 原型系统语音样本的多样性较低,语音标注存在主观性。
      • 没有实现实时的声音转换功能。
    • 未来方向:

      • 开发实时声音合成功能以满足用户实时互动要求。
      • 扩展声音数据集并开放数据,以支持更广泛的语言和文化。
      • 探讨声音定制技术在保护用户隐私和防止犯罪(如伪造声音)方面的设计。

设计推荐

  • 支持多种声音属性调整,如光滑度、变化程度,同时引入音高、语速、和音量等额外参数。
  • 添加情感或个性化的标签搜索功能,例如“#职业化”、“#快乐”等。
  • 提供与用户原声类似但优化的声音建议,以缓解交互中的尴尬,并增强识别性。
  • 支持创建基于场景的声音配置文件,方便用户快速切换至适合的声音设定。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/68931/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3501856
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
会话代理的人格与拟人化、生成式AI(文本、图像、音乐、视频)
work
职业/产业
article
内容状态
已索引正文
hub
相关论文
3 篇相关论文