使用音高、音程和旋律对计算机输入的演唱进行评估

智能语音助手(Alexa、Siri 等)音乐创作与声音设计工具

文献标题

Evaluating Singing for Computer Input Using Pitch, Interval, and Melody

文献信息

  • 主题领域: 通过音乐互动(歌唱)实现人机交互的研究
  • 关键词: 音乐交互, 音高, 音程, 音乐旋律, 非语言输入, 人机交互, 用户体验, 增强现实

研究背景与问题

  • 发现的问题: 当前的声控系统大多依赖于语言指令,这是语言相关的,而非语言的语音交互技术未被充分开发。
  • 重要性: 非语言的交互方式能够提供语言无关且无需复杂计算处理的本地化控制,有助于提升交互的简便性和普适性。
  • 相关工作:
    • 先前研究涵盖了吹气、发元音等非语言声学特征的输入,但很少引入音乐领域的音符、音程等概念。
    • 利用音乐音程和音符设计交互的研究有局限,并且缺乏正式评估。

解决方案

  • 方法: 提出利用歌唱(通过音高、音程和旋律)作为人机交互的一种输入方式。
  • 创新点:
    • 引入音乐概念(大调音阶的七度音)设计互动方式。
    • 将旋律和音程作为区分指令的依据,增强了输入方式的多样性。
    • 系统允许用户通过背景音乐获得参考音高来改进歌唱精准度。
  • 实施步骤:
    1. 提出三种基本交互方式:音高(单个音符)、音程(两个连续音符)和旋律(三个音符的序列)。
    2. 设计了视觉化界面帮助用户校准音程和旋律。
    3. 通过背景音乐提供参考音高刺激。
    4. 开展21名受试者的用户实验评估任务效率与用户体验。
  • 使用的技术:
    • 傅里叶变换提取音高(pitch)。
    • 使用动态时间规整(DTW)算法匹配旋律。
    • 开发基于网络的React实验应用程序,让用户在远程环境中操作。

研究成果

  • 具体成果:
    • 实验参与者的任务完成时间平均为3.5-5秒,训练后错误率在1.3%到8.6%之间。
    • 专家组表现优异,但非歌唱者(novices)的错误率高达46%。
    • 背景音乐对用户主观评价有所帮助,但在总体任务时间和错误率上影响有限。
  • 优势:
    • 与传统基于语音的交互相比,音乐交互方式具有语言独立性。
    • 在可用的非语言输入领域开辟了新的研究方向。
    • 对音乐音程与旋律的引入丰富了系统交互指令的类型。
  • 实验评估结果:
    • 用户反馈显示,交互设计大多数为愉快体验,特别是那些已经有音乐基础的用户适应较快。
    • 错误率与用户背景(音乐训练、日常使用技术的时长)高度相关。
  • 局限性与未来方向:
    • 初学者学习曲线较陡,非歌唱者体验不佳。
    • 背景音乐虽然主观评价较好但对任务性能改进有限,未来可测试其他背景音乐设计。
    • 部分高级交互(如旋律)任务会导致用户疲劳,需进一步优化任务复杂性。

应用场景

  • 补充传统输入方式:
    • 使用音乐输入(如音高、旋律)作为应用程序的快捷键。
    • 可以在绘画应用中快速切换工具、调整参数。
  • 独立输入方式:
    • 在增强现实(AR)设备中,利用歌唱选择颜色或创建 3D 块等操作。
    • 对无键盘鼠标界面的场景提供有效支持。
  • 无视觉反馈场景:
    • 可应用于驾驶场景(改变车内环境参数),或耳机控制音乐与音量。
  • 支持无障碍设计:
    • 为存在运动或语言障碍的用户设计歌唱交互设备。

通过研究,作者为人机交互技术提供了新的可能性,展示了歌唱交互的潜力,以及它如何为多元化的使用场景提供更广阔的支持,同时也为后续研究指明了优化用户群体与交互设计的方向。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/72025/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3517691
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
智能语音助手(Alexa、Siri 等)、音乐创作与声音设计工具
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文