扩散模型生成图像的 photorealism 和 artifacts 特征

生成式AI(文本、图像、音乐、视频)可解释人工智能(XAI)深度伪造与合成媒体检测数据科学家与分析师AI/ML 研究员与工程师HCI 研究员

研究背景与问题

  • 作者发现了哪些问题或挑战? Diffusion模型生成的图像越来越逼真,甚至在许多情况下难以区分真假。然而,这些AI生成的图像通常会包含一些伪像和不合理性,例如人体解剖学上的不合常理、光影错误或者不符合物理规律的场景。这些瑕疵为人类和机器的检测提供了潜在线索,但尚不清楚这些问题在不同的场景中是如何表现的,以及人类识别这些问题的能力如何变化。

  • 为什么这个问题很重要?
    随着生成性AI的广泛应用,伪造图像的数量正在增加,这可能会削弱公众对图像真实性和媒体可信度的信任。尤其是一些高仿真的假照片可能被用于传播错误信息,从而对社会产生消极影响。

  • 研究动机与相关工作
    现有的检测方法,如机器学习模型,对AI生成图像的识别效果往往容易受到后处理修改(如裁剪或压缩)的影响,并缺乏鲁棒性。此外,当前关于GAN生成图像的研究更多,针对Diffusion模型的研究相对较少。研究动机在于通过人类实验揭示Diffusion图像生成模型的能力和局限性,并开发可解释的伪像分类法以帮助公众识别AI生成图像。

解决方案

  • 作者提出了哪些方法或解决方案?

    1. 提出了一种基于人类感知的“图像真写实性”的测量方法(通过人类分辨真假图像的准确度进行客观量化)。
    2. 开发了一种伪像的分类方法,对Diffusion模型生成的图像中的可见特征进行系统性分类。
    3. 进行了一项大规模的在线实验,收集50,444名参与者对599张图像(包括AI生成和真实图片)的分类结果,以评估人类对AI生成图像的检测能力。
  • 该解决方案的创新之处是什么?

    1. 提出了一个全新的伪像分类法,结合了解剖结构、物理定律以及社会文化不合理性等多维度特征。
    2. 在人类心理物理学的框架内,通过准确率反向量化“真写实性”这一抽象概念,有效规避了使用主观问题(如“这张图是否看起来真实?”)可能带来的偏差。
    3. 首次采用大规模实验,通过海量数据分析了影响人类判断的多种因素如场景复杂性、显示时间和人工筛选对模型真实性的影响。
  • 实施步骤是什么?使用了哪些关键技术?

    1. 伪像分类法的开发:通过初步文献研究和生成数千张AI图片,总结出五大伪像类别:解剖不合理性、风格伪像、功能不合理性、物理违背、社会文化不合理性。
    2. 图像生成与整理:分别使用Midjourney、Firefly和Stable Diffusion生成450张图像,并结合149张真实照片,构建实验数据集。
    3. 实验设计和数据收集:开发一个在线实验平台,采用随机的图像显示时间并实时收集参与者的判断准确率。
    4. 数据分析:通过定量和定性分析,比较不同伪像类别下的识别准确率,并分析人类判断能力随显示时间变化的趋势。

研究成果

  • 取得了哪些具体成果?

    1. 分类准确率统计表明,整体上参与者对AI生成图像的平均判断准确率为76%,对真实图像的准确率为74%。但在复杂场景(如多人群像)中,判断准确率显著降低。
    2. 人类对伪像的识别能力与伪像类别强相关,解剖学上的错误(如手指或脸部细节)和风格伪像(如塑料质感)最容易被识别,而功能错误(如非紧绷琴弦)和物理规律违背更难检测。
    3. 图像显示时间对人类准确率有显著影响:1秒显示时间的准确率为72%,而不限制显示时间的情况下准确率提升至82%。
    4. 人工筛选的高质量图像比随机生成的图像更难分辨为假图,揭示了人工干预对提升图像真实性的作用。
  • 与现有解决方案相比,它有哪些优势?

    1. 提供了可解释的伪像分类方法,对图像中人类感知的视觉错误具有高度概括性和适用性。
    2. 使用大规模人类实验及匿名参与者反馈,验证了分类法的有效性和扩展性。
    3. 实验揭示了场景复杂性、显示时间等现实参数如何影响AI生成图像的识别,这在实际应用中更具指导意义。
  • 实验或评估结果是什么?

    • 复杂场景(如多人或动态高背景)的AI图像更容易被识别;
    • 显示时间超过5秒能显著提高判断准确率;
    • 人工筛选可以在一定程度上缓解生成性AI图像质量的局限性。
  • 局限性与未来方向

    1. 局限性
      • 本研究的实验参与者偏向自愿参与和广泛分布,可能存在文化或生活背景的影响,但实验没收集深入的人口学信息。
      • 研究仅限于2024年主流生成性AI模型(Midjourney、Firefly和Stable Diffusion),未来可能需要验证新一代模型的表现及相关伪像。
      • 当前侧重图像识别,视频及音频内容伪造没有涵盖。
    2. 未来方向
      • 探索如何整合该伪像分类法开发AI识别工具或AI素养教育模块。
      • 研究可否扩展该分类于视频和动态场景,挖掘跨帧时间序列伪像的特性。
      • 设计干预实验,以测试基于分类法的教育指导是否能提升人类对AI生成内容的识别能力。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188583/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713962
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、可解释人工智能(XAI)、深度伪造与合成媒体检测
work
职业/产业
数据科学家与分析师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文