看见、听见与共同认知:深度伪造视频检测中的多模态策略

深度伪造与合成媒体检测可解释人工智能(XAI)事实核查员AI/ML 研究员与工程师

文献标题

Seeing, Hearing, and Knowing Together: Multimodal Strategies in Deepfake Videos Detection

出版信息

  • 主题领域: 人类检测深度伪造视频的策略及其对媒体素养的影响。
  • 关键词: 深度伪造检测,多模态策略,媒体素养,视觉线索,音频线索,基于知识的策略,校准,虚假信息,人机协作。

背景与问题

  • 问题/挑战: 人类在可靠检测深度伪造视频方面存在困难,常表现出对判断的过度自信,而现有干预措施缺乏对自然检测策略的清晰理解。
  • 重要性: 深度伪造对信任、声誉和政治稳定构成威胁,因此有效的检测对于打击虚假信息至关重要。
  • 动机与相关工作: 先前研究探讨了人机协作和检测策略的定性分析,但尚未定量研究人类如何在实践中结合视觉、音频和知识线索,以及这些策略如何相互作用。

解决方案

  • 提出的方法: 定量研究人类检测深度伪造视频的策略,重点分析视觉、音频和基于知识的线索在准确性、自信度和校准方面的表现。
  • 创新性:
    1. 提供关于人类在检测真实与深度伪造视频中的准确性和校准的实证证据。
    2. 对多模态策略及其组合进行定量分析。
    3. 绘制线索交互图谱,识别诊断性和误导性模式。
  • 程序和关键技术:
    • 研究包含195名参与者,评估20个视频(10个真实视频,10个深度伪造视频)。
    • 参与者判断视频真实性、评分自信度,并报告使用的线索。
    • 指标包括准确性和期望校准误差(ECE)。
    • 使用统计测试(t检验、ANOVA)和关联规则挖掘分析策略效果及线索交互。

结果

  • 具体发现:
    • 总体准确率:76%(真实视频:79%,深度伪造:72%)。
    • 校准误差(ECE):深度伪造视频较高(0.32),真实视频较低(0.24)。
    • 视觉外观线索对深度伪造视频效果显著(准确率:84%),而音频线索(如语调)对真实视频更具诊断性(准确率:81%)。
  • 相较基线的优势:
    • 多模态策略提升了真实视频的检测效果,但对深度伪造视频的检测提升有限。
    • 结合视觉、音频和知识线索提高了真实视频的准确性和校准水平。
  • 实验/评估:
    • 参与者评估了涵盖多种主题(如政治、娱乐)的公众人物视频。
    • 通过关联规则挖掘和网络图分析线索组合。
  • 局限性与未来工作:
    • 参与者人口统计特征有限(年轻成年人)。
    • 深度伪造操作的多样性不足。
    • 预定义线索清单可能影响自发策略的报告。
    • 未来研究应扩大参与者群体、刺激材料和非提示方法的使用。

总结

本研究定量分析了人类检测深度伪造视频的策略,发现视觉、音频和知识线索的多模态整合提高了真实视频的检测效果,但对深度伪造视频的帮助有限。视觉外观和直觉对识别深度伪造视频有效,而音频线索和先验知识支持了真实视频的检测。校准分析显示人们在深度伪造判断中存在过度自信。研究结果表明,媒体素养干预应注重教授有效线索的使用及识别错误自信。未来研究应扩大人口统计和刺激材料的多样性,以优化检测策略。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/221955/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790480
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
深度伪造与合成媒体检测、可解释人工智能(XAI)
work
职业/产业
事实核查员、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文