文献标题
Cultivating Spoken Language Technologies for Unwritten Languages
文献信息
- 主题领域: 人机交互、自然语言处理、语言学、设计研究
- 关键词: 语音语言, 零资源信息检索, 共创, 田野研究, 参与式设计, 农业文化, 数字鸿沟, 未书写语言
研究背景与问题
作者发现的挑战
- 全球约7000种语言中,有40%的语言处于濒危状态,可能在2050年前灭绝。这些语言中的绝大多数没有数字化资源或支持。
- 当前的数字用户界面和信息检索方法多建立在书写文化的基础上,对主要口头语言社区的适配有限。
- ICT4D(数字技术促进发展)和语音技术创新在服务边缘化社区上仍具有巨大潜力,但其为未书写语言开发的资源极少。
研究重要性
- 跨语言和数字鸿沟的语音技术创新能够平等地赋能全球南方社区和濒危语言。
- 支持口头语言的技术可推动文化实践的数字化保存及增强,与仅记录或保护语言的传统方式形成互补。
研究动机与相关工作
- 作者在印度马哈拉施特拉邦的一个使用未书写语言(Gormati)的社区中,通过参与式方法开展研究,以开发一个易用的语音驱动信息检索系统。
- 当前技术与实践(如传统IVR和IVF平台)在针对口头社区时默认建立了基于书写语言的层级结构,这种结构可能不适用于无文字书写的语言。
- 文献讨论了Orality理论及其如何为用户界面设计提供灵感,特别关注口头文化和思维结构对技术适配的影响。
解决方案
作者提出的方法
- 参与式设计: 与印度Banjaras社区合作,引入HCI、语言学和NLP技术。
- 信息检索系统: 基于语音的检索系统,通过词音识别和排序模型实现跨语音匹配。
- 社会嵌入: 逐步开展田野调查、数据采集和技术开发,引入原型应用于当地评价和共创。
解决方案的创新之处
- 去中心化的开发方法: 不依赖现有书写或数字资源,而是直接从社区贡献的口述数据中起步。
- 迭代参与式研发: 数据需求低,仅需4小时语音数据,且可以随数据集扩展逐步优化。
- 敏感数据处理: 避免书面转录,尊重且适配社区的口头实践和文化结构。
实施步骤与关键技术
- 田野调查与入驻: 通过三次访问深入理解农耕社区及其语言文化框架。
- 数据采集与技术开发:
- 通过照片注释的方式采集Gormati语音数据。
- 使用支持向量机(SVM)以及跨语言音素识别模型开发信息检索系统。
- 测试与评估: 在社区内安装Android原型应用进行正式评价。
- 未来发展: 通过WhatsApp等熟悉的媒介支持持续数据采集,用于训练改良算法。
研究成果
具体成果
- 信息检索准确率: 提出的检索系统在74%的测试用例中,成功返回目标照片作为前5个结果之一。
- 设计方法验证: 证明了基于口头文化和低资源语言开发语音技术的可行性。
与现有解决方案的相比优势
- 文化贴合: 避免语言书写化强加于社区,直接支持口头语言。
- 资源可持续性: 不依赖大规模数据集或复杂技术。
- 影响范围广: 可拓展至其他口头文化社区,而不仅限于单个区域或语言。
实验与评估结果
- 社区成员更自然地使用口头语言描述来查询目标内容,而非关键词或具体短语。
- 在社区实际使用中反馈了定制化使用案例,包括数字化农耕技术、歌曲共享、料理视频等。
局限性与未来方向
- 数据量不足问题: 当前系统的能力受限于可用数据,照片注释任务未能充分激励社区成员持续参与。
- 跨文化适应性: 尽管开展了多次田野测试,该方法的适用性仍待验证于其他语言和地区。
- 下阶段开发: 构建基于社区的平板系统用于媒体存储与访问;设计善于处理诸如歌曲、视频等更复杂的信息检索任务。
结论
- 本论文提出了一种从零开始设计支持未书写语言的语音技术的可行方法,适用于口头文化背景的社区。
- 通过结合多学科方法(HCI、NLP)与行动研究,成功开发出适配少资源语言的语音驱动信息检索系统;该方法基于社区合作构建,以实际可持续的数据收集方式为响应目标语言和文化独特性。
- 未来方向集中于迭代和扩展,以实现技术更广泛和深入的社区激励及参与应用。
对于进一步深度解读和引用,请确保核对论文原始内容。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何从头设计一个适用于口语文化背景和低资源语言的语音驱动信息检索系统?分类: 全球南方、ICT4D 与资源受限社区技术同类问题arrow_forward
- 在设计语音技术时,如何让系统与未书写语言社区的文化和认知结构相兼容?分类: 全球南方、ICT4D 与资源受限社区技术同类问题arrow_forward
- 这种语音技术方法是否能够有效地支持其他缺乏数字资源的口语社区?分类: 全球南方、ICT4D 与资源受限社区技术同类问题arrow_forward
lightbulb
现实痛点
1- 全球许多口语社区无法通过当前书面主导的信息检索技术访问数字资源。分类: 包容性语音AI与文化代表性同类问题arrow_forward
- 67%
用户特征和偏好对使用不熟悉的声音用户界面性能的影响
CHI '19· 语音用户界面(VUI)设计 +1
- 67%
ProxiMic:通过单麦克风检测靠近麦克风的语音实现方便的语音激活
CHI '21· 语音用户界面(VUI)设计 +1
- 67%
Firefox Voice:一个基于网络的开放且可扩展的语音助手
CHI '21· 语音用户界面(VUI)设计 +1
- 67%
Aware: 使用韵律进行自然语音交互的直观设备激活
CHI '22· 语音用户界面(VUI)设计 +1
- 67%
通过声音寻找灵魂伴侣:理解基于在线同步声音的移动约会应用的承诺与挑战
CHI '24· 语音用户界面(VUI)设计 +1
- 67%
重写脚本:为语音交互改编文字指令
DIS '23· 语音用户界面(VUI)设计 +1
- 67%
Radio2Text:使用毫米波射频信号的流式语音识别
UbiComp '23· 语音用户界面(VUI)设计 +1
- 67%
SilentVoice: 通过内吸语音实现不易察觉的语音输入
UIST '18· 语音用户界面(VUI)设计 +1
- 67%
仅需开口:使用智能语音助手减少文本编辑的认知负荷
UIST '21· 语音用户界面(VUI)设计 +1
- 67%
基于应用的任务快捷方式 for 虚拟助手
UIST '21· 语音用户界面(VUI)设计 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642026
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
荣誉提名
group
作者
9 位作者
sell
研究子方向
语音用户界面(VUI)设计、智能语音助手(Alexa、Siri 等)、发展中国家与HCI4D
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文