《我不会无声无息》:为视频会议设计的实时文字转语音演讲工具的设计探索
隐私设计与用户控制家庭语音助手使用体验
文献标题
"I Won't Go Speechless": Design Exploration on a Real-Time Text-To-Speech Speaking Tool for Videoconferencing
文献信息
- 主题领域: 人机交互 (HCI), 远程协作与视频会议
- 关键词: 视频会议, 文本转语音 (TTS), 辅助与替代性通信 (AAC), 用户体验, 实时通信, 语音交互
研究背景与问题
-
问题发现:
- 随着 COVID-19 的普及,视频会议已成为远程工作的关键通信工具。然而,不适合语音交流的空间(如嘈杂的咖啡馆、安静的图书馆或与家人共用空间)限制了用户的参与。
- 在这些环境中,用户常常因麦克风无法使用或担心噪声、隐私问题而无法自由发声。
- 虽然文本聊天可用作替代方案,但当前研究表明,文本聊天容易打破会议流畅性,并且在多方会议中,与基于语音的交流相比,效果较差。
-
重要性: 在未来的"后 COVID-19时代",人们将在更广泛的空间参与视频会议,如何设计支持语音交流受限用户的新工具变得至关重要。
-
研究动机与相关工作:
- 辅助与替代性通信(AAC)系统主要为语音受损或残疾人士设计,当前较少关注其他用户的语境需求。
- 文本转语音(TTS)技术的进步(如语音生成自然性和实时性)带来了在不同场景中应用的潜力,但在多方视频会议实际需求中的充分开发和用户研究相对较少。
- 作者的目标是探索基于 TTS 的实时通信工具如何帮助视频会议用户克服在语音受限环境中的障碍。
解决方案
-
研究方法:
- 使用技术探针(Technology Probe)方法,通过两次实地研究观察用户在视频会议中的行为。
- 设计 TTS 工具原型并通过用户实验探索多方会议场景中的经验。
-
TTS 工具特点:
- 用户输入文本实时转换为合成语音并播放给其他会议参与者。
- 提供一些额外功能:逐字语音播放 ("speak word by word") 和语速、音高调节。
-
创新之处:
- 将 TTS 作为支持实时参与的工具,不仅面向传统 AAC 用户(如语音障碍者),还面向受到语境限制的普通用户。
- 突出了用户体验驱动的设计方法,结合实际使用场景和情境限制探索需求。
-
实施步骤:
- 在 Study 1 和 Study 2 中观察用户通过 TTS 工具参与视频会议的表现。
- 采集会议内容、用户行为视频和访谈记录,并分析工具的可行性、优势、及用户反馈。
研究成果
-
主要结果与发现:
- 与文本聊天相比,TTS 工具能显著增强用户在语音受限情境中的参与感和存在感。
- 用户普遍认可 TTS 工具的价值,但也指出需提升的关键技术与交互设计:
- 语音自然性:需要更好地表达情感和语气。
- 实时性:语音生成稍有延迟影响交流流畅性。
- 用户界面:需要更直观的操作流程,例如快捷键支持、简化的多任务界面。
-
用户需求与挑战:
- 用户在用 TTS 表达态度、语气和笑声等辅助语言时感到受限制。
- 用户希望快速调用常用句式和语音控制选项(如语速、音调)。
- 接收者难以辨别发言者身份,尤其当多个与会者同时使用 TTS。
-
与现有方案的比较:
- 相较于文本聊天,TTS 工具有更强的同步性和参与感。
- 虽然已有 TTS 技术集中于单向内容(如屏幕阅读),本文研究扩展其适用范围,探索其在实时人际交流中的潜力。
-
实验数据与用户反馈:
- Study 1 中,实验表明使用 TTS 工具的与会者在贡献和参与评分上明显高于仅用文本的情况。
- Study 2 强调了可定制性和界面直观性在提升用户体验方面的重要性。
-
未来改进方向:
- 提升语音生成的实时动态性和表达性,如开发更自然的语音合成器。
- 提供更自动化的界面设计,减少用户操作负担。
- 扩展研究场景至更加异质化的用户群体与会议模式(如混合会议,涉及更多发言者的场景等)。
- 探讨基于用户真实声音的 TTS 是否存在隐私与伦理风险。
总结
本文探讨了实时 TTS 工具在语音受限制的视频会议场景中的价值,展示了其显著潜力和研究意义。未来需进一步深入研究特定场景的设计考量,为用户提供更加个性化和高效的语音交互解决方案。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 在语音受限的环境中,实时语音转文字(TTS)工具如何增强用户在视频会议中的参与感?分类: 包容性语音AI与文化代表性同类问题arrow_forward
- TTS工具应如何设计以支持多方视频会议中的实时人际沟通?分类: 包容性语音AI与文化代表性同类问题arrow_forward
- 用户在使用TTS工具时存在哪些情感表达和操作便捷性的需求?分类: 包容性语音AI与文化代表性同类问题arrow_forward
lightbulb
现实痛点
1- 视频会议中,嘈杂环境或隐私问题让用户无法通过语音交流。分类: 包容性语音AI与文化代表性同类问题arrow_forward
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581215
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
隐私设计与用户控制、家庭语音助手使用体验
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文