TalkLess:融合提取式与抽象式语音摘要以保留内容和风格的语音编辑
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作AI 辅助创意写作内容创作者(YouTuber、Podcaster)音乐人、DJ 与声音设计师播客制作人
数百万人收听播客、有声故事和讲座,但编辑语音仍然是一项繁琐且耗时的任务。创作者删除不必要的词语、削减离题的讨论,甚至重新录制语音,以使录音简洁且引人入胜。先前的工作通过删除完整句子(提取)自动摘要语音,但僵硬的提取限制了表达力。AI 工具可以摘要后重新合成语音(抽象),但抽象剥离了说话者的风格。我们提出了 TalkLess,一个灵活结合提取和抽象的系统,在压缩语音的同时保留其内容和风格。编辑语音时,TalkLess 首先生成可能的转录编辑,选择最大化压缩率、覆盖度和音频质量的编辑,然后使用语音编辑模型将转录编辑转换为音频编辑。TalkLess 的界面通过将低级用词编辑(通过压缩面板)与主要内容编辑(通过大纲面板)分离,为创作者提供对自动编辑的控制。TalkLess 实现了比最先进的提取式方法更高的覆盖度并能删除更多语音错误。一项比较研究(N=12)显示,TalkLess 显著降低了语音编辑中的认知负荷和编辑工作量。我们进一步展示了 TalkLess 的潜力,在一项探索性研究(N=3)中,创作者编辑了自己的语音。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3746059.3747795
一眼看懂
fact_check论文快照
dataset
来源
UIST
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、AI 辅助创意写作
work
职业/产业
内容创作者(YouTuber、Podcaster)、音乐人、DJ 与声音设计师、播客制作人
article
内容状态
仅摘要
hub
相关论文
1 篇相关论文