揭示确定真实和伪造音频中的人类特征:来自盲人和视力正常个体的见解

可解释人工智能(XAI)听觉障碍者支持(字幕、手语、振动)深度伪造与合成媒体检测辅助技术专家HCI 研究员

文献标题

揭示人类特征在鉴别真实与欺骗音频中的作用:来自盲人与视力正常个体的见解(Uncovering Human Traits in Determining Real and Spoofed Audio: Insights from Blind and Sighted Individuals)

文献信息

  • 主题领域: 人类与人工智能协作、人机交互、音频真实性检测、欺骗音频对抗技术
  • 关键词: 音频感知, 生成式AI, 深度伪造音频, 盲人, 视力正常, 自动语音合成(TTS), 真实音频, 欺骗音频, 重放攻击, 音频水印, 人工智能协作

研究背景与问题

  • 问题或挑战:
    • 随着生成式人工智能的发展,人们越来越难以区分真实人类语音和机器生成语音。
    • 盲人无法依赖视觉线索(如视频中的面部表情或光影不一致),可能更依赖音频来判断真实性。
  • 重要性:
    • 欺骗音频技术的泛滥可能影响包括银行、智能语音助手等领域的安全性。
    • 探讨盲人与视力正常个体的音频感知差异有助于优化防范措施,并可能影响未来音频技术设计。
  • 研究动机与相关工作:
    • 现有的自动语音验证系统面临生成式AI带来的欺骗音频生成挑战。
    • 以前研究强调视觉损伤与听觉能力的相关性,但很少探索盲人如何感知音频真实性。

解决方案

  • 方法:
    • 通过两项实验研究,探讨盲人和视力正常个体对音频真实性的判断过程。
    • 在第一项研究中,招募12位盲人参与者对63个困难音频样本进行分类,并通过访谈了解其决策依据。
    • 在第二项研究中,扩大样本规模至60位参与者(30盲人+30视力正常个体),用于对96个音频样本进行分析。
  • 创新之处:
    • 提出了人类在音频真实性判断中的独特优势:关注发音、语气、呼吸声、情绪等人类特质。
    • 探讨了盲人与视力正常个体的认知模型差异,强调了视觉线索在生成音频的影响。
  • 实施步骤:
    • 第一项实验:实验提供音频样本,记录决策过程及参与者的信心、挑战点。
    • 第二项实验:更大规模的线上问卷调查,收集不同个体的回答和开放式反馈。
    • 定量数据分析与文本分析相结合,总结关键发现并提出设计与政策建议。

研究成果

  • 具体成果:
    • 盲人与视力正常个体均能识别音频真实性,并且他们的准确性显著高于当前最先进的机器学习模型(如 ASSERT 算法,在挑战样本上的准确率为 0%)。
    • 两组参与者对不同欺骗音频类型的识别表现有所不同:
      • 盲人表现更好的是 TTS 生成音频(准确率:91%)。
      • 视力正常者表现更出色的是深度伪造音频(准确率:71%)。
    • 两组对重放攻击音频的识别都表现较差(平均准确率低于 50%)。
  • 优势:
    • 盲人倾向于基于自身长期使用自动语音合成工具的经验进行判断,这使其在识别 TTS 生成音频方面精确性高。
    • 视力正常者使用视觉化的心理模型,比如假定音频中语句对应具体的面部表情或发音方式,帮助其更好地检测深度伪造音频。
  • 局限性与未来方向:
    • 当前研究的样本类别不完全平衡,尤其是深度伪造和 TTS 数据较少。
    • 重放音频的复杂性及现实场景中的泛滥需要进一步研究。
    • 提议未来设计基于人类特质的二分类器和可感知的音频水印技术。
    • 探索通过人机协作机制(如不确定性量化或延迟学习架构),优化欺骗音频检测。

设计与社会影响

  • 设计启发:
    • 改善辅助工具(如屏幕阅读器),采用更现实的深度伪造声音,以提高用户体验。
    • 开发以人类可感知为主的水印机制,帮助用户快速区分 AI 生成内容。
    • 利用判断音频真实性的专家参与机制,启发招聘或协作领域。
  • 社会影响:
    • 随着欺骗技术的增强,盲人与视力正常者都有可能增加认知负担,这提示安全设计应减轻用户验证压力。
    • 利用 AI 辅助工具增加盲人的就业机会,例如让他们成为受训练的安全音频判定专家。

本研究深化了对机器操控音频的认知,为未来的智能交互、技术设计与公共政策提供关键见解。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/146813/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642817
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
可解释人工智能(XAI)、听觉障碍者支持(字幕、手语、振动)、深度伪造与合成媒体检测
work
职业/产业
辅助技术专家、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文