给机器人一个声音:人机交互声音创造和开放式标注
作者
会话代理的人格与拟人化社交机器人交互软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师
文献标题
Giving Robots a Voice: Human-in-the-Loop Voice Creation and Open-ended Labeling
文献信息
- 主题领域: 人机交互、机器人形象设计、语音合成
- 关键词: 人机交互、机器人语音、语音生成工具、开放标签、语音预测、文本到语音合成
研究背景与问题
- 问题或挑战: 机器人外观与语音之间的对齐对于提高机器人可用性至关重要,但当前研究对机器人声音的探索维度有限,且现有的声音种类缺乏多样性。此外,生成适合于多种机器人外观的语音仍面临技术和方法上的挑战。
- 重要性: 机器人语音是人机交互中的核心部分,能传递意图、个性和情绪等信息。如果机器人外观和语音不匹配,会引发不适、怪异感甚至抗拒反应,影响用户体验与功能实现。
- 研究动机与相关工作:
- 现有研究强调视觉外观与语音之间的关联,但分析维度有限且数据集规模较小。
- 最新的文本到语音(Text-To-Speech, TTS)合成技术能生成逼真的人类语音,但缺乏适配不同类型机器人的合成语音工具。
- 人机交互中的语音选择仍被视为专家任务,手动操作效率低且容易受到主观偏好影响。
解决方案
- 方法与解决方案:
- 提出了一种五步方法实现机器人语音的创建和预测:
- 开发语音创建工具:结合最新的TTS技术与传统信号处理,覆盖从高度合成到自然化语音。
- 匹配语音与机器人外观:采用人机协作的语音生成范式(Gibbs Sampling with People, GSP),让参与者通过迭代调整参数找到最适合每个机器人图像的语音。
- 识别机器人感知属性:通过文献回顾和自适应标签挖掘方法(Sequential Transmission Evaluation Pipeline, STEP-Tag),挖掘与机器人形象相关的感知标签。
- 属性维度评级:对机器人外观图像及语音样本进行多维评价。
- 预测新机器人语音:基于匹配模型预测新机器人的合适语音。
- 提出了一种五步方法实现机器人语音的创建和预测:
- 创新之处:
- 将认知科学与机器学习结合,为语音生成工具开发提供了全新的框架。
- 提供开放的语音生成和预测工具以供工程师使用。
- 系统性地总结机器人形象与语音之间的感知属性,并进行数据驱动的匹配与预测。
- 实施步骤及关键技术:
- 语音生成: 使用TTS技术生成自然语音,结合音频效果(如音调变化、失真等)调整语音特点。
- 标签挖掘: 通过STEP-Tag为机器人图像或语音创建开放式标签,将参与者的感知转换为可衡量的数据集。
- 匹配模型: 基于实验数据通过图像评分预测合适的语音。
研究成果
- 具体成果:
- 设计并验证了一种覆盖广泛语音类型的机器人语音创建工具。
- 创建了一个由175种机器人及其匹配语音组成的大型数据集,涵盖多个应用场景。
- 开发了一个在线接口工具,可供工程师定制机器人语音,并能预测新机器人的语音。
- 证明了感知维度可以有效预测未见机器人的合适语音。
- 优势:
- 系统性地覆盖了语音匹配的多维度,包括技术性和认知性两个视角。
- 解决了机器人外观与语音之间的对齐问题,并实现实际应用工具的开发。
- 实验与评估结果:
- 通过2505名参与者验证,语音匹配评分在多轮迭代后显著提升。
- 独立验证实验表明,新机器人与语音的预测准确性在评分中得到高分。
- 数据集的鲁棒性测试显示结果具有跨数据集的普适性。
- 局限性与未来方向:
- 未考虑机器人运动或动态交互对语音匹配的影响。
- 数据集和方法主要基于英语,尚未扩展到多语言或非西方文化环境。
- 声音模型的表现尚未达到完美匹配,需要更高维度的语音参数化。
- 未来方向包括探索机器人动态材料(如视频)及长文本语音内容在感知上的影响,扩展研究至不同文化和语言环境。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何创建并预测与机器人外观一致的多样化语音?分类: 机器人外观与多模态表达设计同类问题arrow_forward
- 采用人类介入的语音生成方法如何提高机器人语音与外观的匹配度?分类: 机器人外观与多模态表达设计同类问题arrow_forward
- 哪些感知属性可以用于界定机器人形象与语音的匹配关系?分类: 机器人外观与多模态表达设计同类问题arrow_forward
lightbulb
现实痛点
1- 机器人语音与外观不匹配,导致用户不适和功能损害。分类: 机器人外观与多模态表达设计同类问题arrow_forward
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642038
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
会话代理的人格与拟人化、社交机器人交互
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
3 篇相关论文