一个新的恐怖谷?语音保真度和人类听众性别对虚拟人类说话者社交认知的影响

智能语音助手(Alexa、Siri 等)会话代理的人格与拟人化

文献结构化整理与要点提炼

文献标题

A New Uncanny Valley? The Effects of Speech Fidelity and Human Listener Gender on Social Perceptions of a Virtual-Human Speaker

文献信息

  • 主题领域: 语音合成技术对虚拟人类社会认知的影响
  • 关键词: 虚拟人类, 社会认知, 语音合成技术, 性别影响, 人机交互

研究背景与问题

问题与挑战

  • 存在广泛应用的虚拟人类作为说服性代理,但其话语呈现方式(尤其是使用文本到语音技术)对社会认知的影响仍未完全了解。
  • 合成语音通常被认为不如人类录制语音可信和自然。神经文本到语音技术(Neural TTS)虽然比现有技术更逼近人类语音,但其对社会认知的效果需进一步验证。
  • 听者的性别是否影响对虚拟人类语音的社会认知仍不明确。

重要性

  • 社会认知对于虚拟人类的接受度及用户体验至关重要,在信任和技术采纳方面有关键作用。在虚拟人类广泛用于医疗咨询和能源保护等说服场景时,这些认知会直接影响应用效果。

研究动机与相关工作

  • 从语音质量到社会认知的分析存在分歧。早期研究表明合成语音与人类语音的社会认知差异,但结果不一致。
  • 虽然神经文本到语音技术被认为更自然、更贴近人类语音,但是否能够提高虚拟人类的社交认知仍有待验证。
  • 性别对技术接受度影响的研究通常不够纵深,该研究试图填补这方面的空白。

解决方案

方法或解决方案

  • 使用3×2的实验设计,评估三种语音技术(标准语音合成技术Standard TTS、神经语音合成技术Neural TTS、和人类录制语音)在不同听者性别(男性和女性)下对虚拟人类社会认知与说服效果的影响。
  • 测试虚拟人类的社会认知评价,包括作为演说者的能力、可信度和勇气,以及对演讲内容、论点和语音的感知。

创新之处

  • 首次直接比较神经TTS与标准TTS,以及从听者性别角度探讨社会认知差异。
  • 仿照早期方法设计,但增加了现代TTS技术尤其是神经TTS的测试,为未来虚拟人类改进设计提供依据。

实施步骤与关键技术

  1. 创建3种语音条件(Standard TTS、Neural TTS和Human Speech),所有语音均与虚拟人类同步。
  2. 通过问卷和评分评估社会认知与说服效果。
  3. 使用Amazon Polly工具生成的标准和神经文本到语音技术。
  4. 参与者验证码数据分析采用主成分分析(PCA)和方差分析(ANOVA)。

研究成果

具体成果

  • TTS(文本到语音技术)语音条件未能显著改善对虚拟人类的社会认知。相比标准TTS,使用神经TTS的虚拟人类被认为更不可信。
  • 并非所有听者都同样响应语音质量:男性听者在可信度维度上显著低于女性听者。
  • 听者对合成语音的负面评价可能与“幽灵谷效应”有关,该效应描述了由近似真实但未能完全逼真人类语音引发的不适感。

与现有解决方案的优势

  • 提供了关于现代TTS技术是否能够改善用户体验的实证数据。
  • 挖掘听者性别与社会认知之间的复杂交互关系,为设计性别敏感的虚拟人类提供指导。

局限性与未来方向

  • 实验仅限于女性虚拟人类和预设的说服论题,未包含对不同性别或种族虚拟人类的研究。
  • 聆听者群体主要来自美国大学,无法完全代表一般人口。
  • 后续研究应扩展至其他文化背景、更丰富的虚拟人类外观设计,以及混合定量与定性方法进行数据收集。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/72043/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3517564
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
智能语音助手(Alexa、Siri 等)、会话代理的人格与拟人化
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文