熵的测量能否匹配人类对AI生成图像多样性的判断?
作者
生成式AI(文本、图像、音乐、视频)可解释人工智能(XAI)创意协作与反馈系统AI/ML 研究员与工程师HCI 研究员UI/UX 设计师
文献标题
Do Entropic Measurements of the Diversity of AI-generated Images Match Human Judgement?
出版信息
- 研究领域: 测量和理解生成式AI图像在创意应用中的多样性。
- 关键词: 文本生成图像模型,多样性测量,基于熵的指标,人类判断,创意任务,Stable Diffusion,生成式AI,人机交互,算法多样性,主题分析。
背景与问题
- 问题/挑战: 现有的文本生成图像模型基准主要关注图像质量和与提示的匹配度,却忽视了生成输出的多样性。当前的多样性测量方法通常需要大型参考数据集或大量样本,因此不适合交互式应用。此外,这些方法尚未充分验证其与人类判断的一致性。
- 重要性: 多样性对于支持开放性任务中的创造力至关重要,在这些任务中,用户需要广泛的选项来探索新颖的想法。如果没有可靠的多样性测量方法,生成式AI系统可能无法充分支持创意和发散性思维。
- 动机与相关工作: 之前的研究探讨了生成式AI中的新颖性和多样性,但缺乏可靠的标准或经过验证的测量方法。现有指标如Inception Score和Frechét Inception Distance更关注数据集覆盖率,而非对特定提示的响应多样性。本文基于熵的多样性测量方法,并旨在验证其与人类判断的一致性。
解决方案
- 提出的方法: 本文评估了基于熵的多样性测量方法(截断熵、Rényi核熵和Vendi Score),用于小规模AI生成图像集,并将其与人类的多样性判断进行比较。
- 创新点:
- 开发了一个用于基准测试图像多样性的噪声控制数据集。
- 验证了基于熵的多样性测量方法与人类判断的一致性。
- 通过定性分析识别了人类多样性判断的六个关键主题。
- 提供了关于多样性测量在创意任务中局限性和适用性的洞见。
- 流程与关键技术:
- 使用Stable Diffusion生成具有不同噪声水平的图像集。
- 应用基于熵的多样性测量方法(TE、RKE、VS)评估多样性。
- 进行三项用户研究:多样性定量排名(研究1和研究2)和人类多样性判断的定性分析(研究3)。
- 使用Spearman’s ρ和Kendall’s τ分析算法测量、噪声水平和人类排名之间的相关性。
- 对参与者对多样性描述的主题进行分析。
结果
- 具体发现:
- 研究1:在人类排名与算法测量之间发现了强相关性,尤其是多样性差异较大的情况下(Spearman’s ρ = 0.896,Kendall’s τ = 0.882)。
- 研究2:在细微的多样性差异中,人类与算法的对齐程度适中,且在人类和算法都表现不佳的提示上表现一致(Spearman’s ρ = 0.225,Kendall’s τ = 0.201)。
- 研究3:在人类多样性判断中识别出六个主题:焦点、细节、上下文、构图、风格和氛围/情感。
- 相较基线的优势: 基于熵的测量方法(TE、VS)能够有效近似人类的多样性判断,即使是针对小规模图像集。RKE由于对样本需求较高而实用性较低,但在模型训练中具有可微分性。
- 实验/评估:
- 研究1:31名参与者对具有大噪声差异的图像集进行排名。
- 研究2:162名参与者对具有细微噪声差异的图像集进行排名。
- 研究3:80名参与者描述图像集的相似性和差异,并通过主题分析进行研究。
- 指标:Spearman’s ρ、Kendall’s τ和主题编码。
- 局限性与未来工作:
- 排除了包含人类主体的图像,限制了研究的普适性。
- 基于噪声的多样性生成可能无法跨提示或模型泛化。
- 未对识别出的多样性主题进行验证性因子分析。
- 未来工作应探索包含人类主体的图像多样性,并测试多样性是否能增强创造力。
总结
本文强调了多样性作为文本生成图像模型在创意任务中的基准的重要性。通过使用噪声控制数据集验证了基于熵的多样性测量方法(TE、VS)与人类判断的一致性,并识别了人类多样性判断的六个主题。这些测量方法与人类感知在大多样性差异情况下表现良好,但在细微差异和输出不稳定的提示上仍面临挑战。研究结果为改进多样性指标和设计更好支持探索和创意的生成式AI系统奠定了基础。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 71%
重新审视人类与AI交互的独特设计难度及其原因
CHI '20· 生成式AI(文本、图像、音乐、视频) +2
- 71%
“即使不是真实的我也开心”:生成式AI照片编辑作为记忆体验
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
偏好引导的提示优化用于文生图生成
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
减少重绘,多加探索:草图到图像的建议与补全
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
与生成式AI合作:模型主导和人类主导交互在人机共创中的实验评估
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
Canvas3D:通过3D虚拟画布的约束为图像生成赋予精确空间控制能力
IUI '26· 生成式AI(文本、图像、音乐、视频) +2
- 67%
自适应滑块:基于用户对齐语义滑块的文本到图像模型输出编辑
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 67%
VizCrit:视觉设计工具中计算反馈展示策略的探索
CHI '26· 生成式AI(文本、图像、音乐、视频) +1
- 67%
构建用于创意工作的人类-多智能体团队
CHI '26· 生成式AI(文本、图像、音乐、视频) +1
- 67%
超越生产力:重新思考创造力支持工具的影响
C&C '25· 生成式AI(文本、图像、音乐、视频) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791383
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、可解释人工智能(XAI)、创意协作与反馈系统
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文