揭示确定真实和伪造音频中的人类特征:来自盲人和视力正常个体的见解
可解释人工智能(XAI)听觉障碍者支持(字幕、手语、振动)深度伪造与合成媒体检测辅助技术专家HCI 研究员
文献标题
揭示人类特征在鉴别真实与欺骗音频中的作用:来自盲人与视力正常个体的见解(Uncovering Human Traits in Determining Real and Spoofed Audio: Insights from Blind and Sighted Individuals)
文献信息
- 主题领域: 人类与人工智能协作、人机交互、音频真实性检测、欺骗音频对抗技术
- 关键词: 音频感知, 生成式AI, 深度伪造音频, 盲人, 视力正常, 自动语音合成(TTS), 真实音频, 欺骗音频, 重放攻击, 音频水印, 人工智能协作
研究背景与问题
- 问题或挑战:
- 随着生成式人工智能的发展,人们越来越难以区分真实人类语音和机器生成语音。
- 盲人无法依赖视觉线索(如视频中的面部表情或光影不一致),可能更依赖音频来判断真实性。
- 重要性:
- 欺骗音频技术的泛滥可能影响包括银行、智能语音助手等领域的安全性。
- 探讨盲人与视力正常个体的音频感知差异有助于优化防范措施,并可能影响未来音频技术设计。
- 研究动机与相关工作:
- 现有的自动语音验证系统面临生成式AI带来的欺骗音频生成挑战。
- 以前研究强调视觉损伤与听觉能力的相关性,但很少探索盲人如何感知音频真实性。
解决方案
- 方法:
- 通过两项实验研究,探讨盲人和视力正常个体对音频真实性的判断过程。
- 在第一项研究中,招募12位盲人参与者对63个困难音频样本进行分类,并通过访谈了解其决策依据。
- 在第二项研究中,扩大样本规模至60位参与者(30盲人+30视力正常个体),用于对96个音频样本进行分析。
- 创新之处:
- 提出了人类在音频真实性判断中的独特优势:关注发音、语气、呼吸声、情绪等人类特质。
- 探讨了盲人与视力正常个体的认知模型差异,强调了视觉线索在生成音频的影响。
- 实施步骤:
- 第一项实验:实验提供音频样本,记录决策过程及参与者的信心、挑战点。
- 第二项实验:更大规模的线上问卷调查,收集不同个体的回答和开放式反馈。
- 定量数据分析与文本分析相结合,总结关键发现并提出设计与政策建议。
研究成果
- 具体成果:
- 盲人与视力正常个体均能识别音频真实性,并且他们的准确性显著高于当前最先进的机器学习模型(如 ASSERT 算法,在挑战样本上的准确率为 0%)。
- 两组参与者对不同欺骗音频类型的识别表现有所不同:
- 盲人表现更好的是 TTS 生成音频(准确率:91%)。
- 视力正常者表现更出色的是深度伪造音频(准确率:71%)。
- 两组对重放攻击音频的识别都表现较差(平均准确率低于 50%)。
- 优势:
- 盲人倾向于基于自身长期使用自动语音合成工具的经验进行判断,这使其在识别 TTS 生成音频方面精确性高。
- 视力正常者使用视觉化的心理模型,比如假定音频中语句对应具体的面部表情或发音方式,帮助其更好地检测深度伪造音频。
- 局限性与未来方向:
- 当前研究的样本类别不完全平衡,尤其是深度伪造和 TTS 数据较少。
- 重放音频的复杂性及现实场景中的泛滥需要进一步研究。
- 提议未来设计基于人类特质的二分类器和可感知的音频水印技术。
- 探索通过人机协作机制(如不确定性量化或延迟学习架构),优化欺骗音频检测。
设计与社会影响
- 设计启发:
- 改善辅助工具(如屏幕阅读器),采用更现实的深度伪造声音,以提高用户体验。
- 开发以人类可感知为主的水印机制,帮助用户快速区分 AI 生成内容。
- 利用判断音频真实性的专家参与机制,启发招聘或协作领域。
- 社会影响:
- 随着欺骗技术的增强,盲人与视力正常者都有可能增加认知负担,这提示安全设计应减轻用户验证压力。
- 利用 AI 辅助工具增加盲人的就业机会,例如让他们成为受训练的安全音频判定专家。
本研究深化了对机器操控音频的认知,为未来的智能交互、技术设计与公共政策提供关键见解。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 视觉和非视觉线索如何影响盲人和视力正常者判断音频真实性的能力?分类: 盲人与低视力无障碍同类问题arrow_forward
- 盲人和视力正常者在识别不同类型伪造音频(如TTS生成音频、深度伪造音频、回放攻击音频)时表现有何差异?分类: 盲人与低视力无障碍同类问题arrow_forward
- 如何利用人类特质优化伪造音频检测系统的设计?分类: 盲人与低视力无障碍同类问题arrow_forward
lightbulb
现实痛点
1- 用户难以分辨真实和AI生成的音频,增加安全风险。分类: 盲人与低视力无障碍同类问题arrow_forward
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642817
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
可解释人工智能(XAI)、听觉障碍者支持(字幕、手语、振动)、深度伪造与合成媒体检测
work
职业/产业
辅助技术专家、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文