文本到图像生成中默认图像的探索
荣誉提名作者
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作AI 辅助决策与自动化系统可解释人工智能(XAI)AI/ML 研究员与工程师UI/UX 设计师HCI 研究员
文献标题
An Exploration of Default Images in Text-to-Image Generation
出版信息
- 主题领域: 探讨文本生成图像(TTI)系统中的默认图像现象。
- 关键词: 文本生成图像, 默认图像, Midjourney, 提示工程, 生成式人工智能, 用户满意度, 计算创造力, 潜在空间, 模式崩溃, 人机交互。
背景与问题
- 问题/挑战: 当遇到未知或模糊术语时,TTI 模型会生成默认图像——即从不相关提示中产生的视觉上相似的输出。这一现象尚未被深入研究,但它影响了用户满意度和创意工作流程。
- 重要性: 理解默认图像可以改进提示工程、提高模型的鲁棒性和用户体验,同时填补计算创造力和语义对齐方面的空白。
- 动机与相关工作: 之前的研究集中于提示工程、失败模式和 TTI 系统中的用户满意度,但默认图像尚未被研究。本论文基于模式崩溃和生成模型偏差的研究,系统性地探讨默认图像现象。
解决方案
- 提出的方法: 对 Midjourney 中的默认图像进行系统性研究,结合手动实验、用户研究和大规模计算分析。
- 创新点:
- 定义并实证描述默认图像,包括六类可能触发默认图像的提示类别。
- 开发一种可扩展的方法,通过聚类和过滤技术识别默认图像。
- 创建包含 189,432 个提示和 757,728 张图像的数据集,用于未来研究。
- 提出描述默认图像特征的八条假设。
- 流程与关键技术:
- 手动创建六类提示(如稀有名称、低资源语言、故障词元)共 130 个。
- 使用固定参数进行图像生成实验,并通过消融研究测试变量性。
- 使用亲和图法基于视觉相似性识别默认图像。
- 进行在线用户研究(N=48),评估默认图像对用户满意度的影响。
- 对 Midjourney 生成的 757,728 张图像进行计算分析,利用 CLIP 嵌入、聚类和过滤技术识别默认图像簇。
结果
- 具体发现:
- 在手动实验中识别出十个典型的默认图像,这些图像在不相关提示中反复出现。
- 计算分析发现 4,715 个默认图像簇(共 36,243 张图像,占数据集的 4.84%)。
- 默认图像通常具有人-动物或人-植物融合、梦幻般的主题和美学偏向。
- 用户研究显示默认图像显著降低用户满意度(例如,Q4 满意度均值 = 2.4,标准差 = 1.9)。
- 相较基线的优势:
- 首次对默认图像进行系统性研究,提供了实证证据和可扩展的检测方法。
- 展示了默认图像在创意用户提示中的实际影响。
- 实验/评估:
- 使用 130 个提示进行手动实验,生成 520 张图像。
- 对种子值、风格修饰符和模型版本进行消融研究。
- 用户研究评估默认图像对满意度的影响(N=48)。
- 使用聚类和语义过滤对 757,728 张图像进行计算分析。
- 局限性与未来工作:
- 研究仅限于 Midjourney,结果可能无法推广到其他 TTI 系统。
- 缺乏对模型内部和训练数据的访问限制了因果解释。
- 未来工作可探索其他系统中的默认图像、个性化效果以及实时检测机制。
总结
本文首次系统性地研究了 Midjourney(一种 TTI 生成系统)中的默认图像现象。默认图像是由模糊或未知提示引发的,通过手动实验、用户研究和对 757,728 张图像的计算分析进行了表征。研究识别了重复出现的主题、用户对默认图像的不满以及描述其特性的八条假设。通过定义和分析默认图像,本文强调了其对用户体验和创意工作流程的影响,为改进生成式人工智能系统和支持未来研究奠定了基础。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
使用生成式AI创建和评估人物角色:对81篇文章的范围性综述
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 86%
重新审视人类与AI交互的独特设计难度及其原因
CHI '20· 生成式AI(文本、图像、音乐、视频) +2
- 86%
基于LLM的搜索对决策制定的影响:速度、准确性和过度依赖
CHI '25· 大语言模型(LLM)的人机协作 +2
- 86%
用户如何看待混合主动AI:问题解决中协助的态度研究
IUI '26· 大语言模型(LLM)的人机协作 +2
- 86%
文本到图像生成的自适应提示引导
IUI '26· 生成式AI(文本、图像、音乐、视频) +2
- 75%
GAM 教练:迈向交互式和用户中心的算法补救
CHI '23· 生成式AI(文本、图像、音乐、视频) +3
- 75%
通过语义指导桥接UI生成中的鸿沟
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 75%
PCGEF:用于诊断以人为中心的角色条件生成中主观一致性的框架
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
代理音频主持人与人类在出声思考可用性测试中的对比
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 75%
设计反馈:理解并克服对话智能体中用户反馈障碍
CHI '26· 大语言模型(LLM)的人机协作 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790681
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、可解释人工智能(XAI)
work
职业/产业
AI/ML 研究员与工程师、UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文