柯南的领结:用于 VTuber 实时直播的流式语音转换

智能语音助手(Alexa、Siri 等)AI 辅助创意写作电竞运动员与直播主播内容创作者(YouTuber、Podcaster)

近年来,虚拟主播(VTuber)作为一种社交媒体新业务在YouTube、Twitch和TikTok上呈现爆发式增长。然而,由于配音演员的健康问题或退休,维护VTuber化身的可识别声音成为一个尚未解决的关键问题。一种可能的解决方案出现在热门动画片《名侦探柯南》中的柯南领结变声器。为实现这一目标,我们引入了VTuberBowTie——一种用于VTuber实时直播的用户友好流式语音转换系统。我们提出了一种创新的流式语音转换方法,解决了传统实时语音转换固有的有限上下文建模和双向上下文依赖问题。与单独处理数据块中的语音流不同,我们的方法采用全顺序结构,利用输入块之前的上下文信息,从而扩展感知范围并实现无缝拼接。此外,我们为VTuberBowTie开发了即用型交互界面,并将其部署在各种计算平台上。实验结果表明,VTuberBowTie能够以流式方式实现高质量语音转换,在CPU上延迟为179.1ms,在GPU上延迟为70.8ms,同时为用户提供友好的交互体验。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/139194/2024

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
智能语音助手(Alexa、Siri 等)、AI 辅助创意写作
work
职业/产业
电竞运动员与直播主播、内容创作者(YouTuber、Podcaster)
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文