是AI还是我?理解用户使用文本到图像生成AI工具的提示旅程
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作UI/UX 设计师数据科学家与分析师AI/ML 研究员与工程师
文献标题
Is It AI or Is It Me? Understanding Users’ Prompt Journey with Text-to-Image Generative AI Tools
文献信息
- 主题领域: 人机交互、生成式人工智能、用户体验研究
- 关键词: 提示工程, 生成式AI, 文本到图像生成, 用户旅程, 人机交互, 创造力工具, Midjourney, AI提示优化
研究背景与问题
-
发现的问题或挑战:
- 文本到图像生成工具(如Midjourney)的用户在设计提示(prompts)时往往不能直接实现其设计目标,提示的复杂性和多样化仍是用户使用中的主要阻碍。
- 当前关于提示指南、手册以及“提示工程”研究大多过于理论化,未完全考虑到用户的真实目的和实践挑战。
- 生成式AI输出与用户目标之间存在错位,且用户需克服技术学习曲线来提高工具的有效使用。
-
重要性与动机:
- 生成式AI在创意领域(如图形设计、建筑设计等)的应用逐步广泛,深入理解用户如何直观地设计提示对于完善工具设计至关重要。
- 透视用户编写、评估和优化提示过程的具体案例,将有助于更好地匹配工具能力与用户的创造性目标,同时推动生成式AI工具的用户教育及社区参与。
-
研究问题:
- 用户在文本到图像生成工具中的典型提示设计过程是什么?
- 用户在提示设计过程中存在哪些主要障碍?
解决方案
-
方法或解决方案:
- 通过半结构化访谈,研究了19位Midjourney用户的提示设计过程及挑战。
- 提出“一种用户提示旅程模型”,该模型包含提示结构设计、图像评估和提示精炼三个阶段的具体策略。
-
创新点:
- 提炼了五种常见的提示结构:描述性句子、模板、概览+细节、分段模式以及单词序列。
- 阐明了用户如何根据各阶段的目标与内容类型来评估及优化生成图像。
- 发现了用户提示创作既是个人行为又是社交协作行为,强调了“协作提示创作”和“提示学习”在生成式AI社区中的作用。
-
实施步骤及技术:
- 访谈过程分为两个阶段:用户背景调查及提示和生成案例的回放分析。
- 数据分析采用主题分析法,通过归纳整理访谈内容提炼出模式与挑战。
- 使用Midjourney生成图像工具,分析其输入输出流程及用户对提示优化的策略。
研究成果
-
具体成果:
- 提示结构: 五种提示结构策略的特征与适用场景(如“描述性句子”适合新手,“分段模式”提供对细节的更高掌控力等)。
- 评估标准: 生成图像的评估标准主要分为内容物和视觉设计两个层面,包括真实感、细节、颜色、构图等指标。
- 优化策略: 用户采用的提示优化方法包括增加描述词、移除不必要词语、改变词序、调整权重参数以及重新生成等流程。
-
与现有方案的比较:
- 将用户的提示旅程与社区学习相结合,将交互行为视作内在个体体验的探索和外在社交学习的扩展,在文献中有新颖意义。
- 研究不仅停留于理论建模,而是深度挖掘了用户的现实操作与心理。
-
实验或评估结果:
- 提示旅程是一个动态的迭代过程,用户的目标在创作过程中会不断调整。
- 不同经验级别的用户面临的阻碍不同,初学者更多依赖随机生成,而熟练者更倾向于控制提示结构。
-
局限性与未来方向:
- 局限性:
- 本研究仅聚焦于Midjourney工具,未覆盖其他类似生成式AI工具的提示模式差异。
- 访谈对象来自单一语言和文化背景,未能反映跨文化使用场景。
- 未来方向:
- 深入研究不同生成式AI工具下的提示模式对比。
- 扩展研究范围,包含更多元背景及跨文化用户。
- 探讨社区驱动的“提示学习”系统如何影响用户创造力及工具改进。
- 局限性:
总结
通过详细的用户访谈分析,本研究揭示了Midjourney用户在提示结构设计、图像评估及优化过程中的策略与挑战,为生成式AI工具的人本设计提供了重要指引。这一研究为未来开发更智能、个性化和用户友好的文本到图像生成系统奠定了理论基础。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
2- 文本生成图像工具用户的典型构造提示词流程是什么?分类: 生成式图像创作与编辑控制同类问题arrow_forward
- 用户在构造提示词过程中面临哪些主要障碍?分类: 生成式图像创作与编辑控制同类问题arrow_forward
lightbulb
现实痛点
1- 用户用生成式AI工具创作提示词时常难以实现目标效果。分类: 生成式图像创作与编辑控制同类问题arrow_forward
- 80%
IntentTuner:将人类意图整合到文本到图像生成模型微调中的交互框架
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 80%
AI仪器:将提示作为工具来抽象和反映图形界面命令作为通用工具
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 67%
MUD:面向大规模和噪声过滤的现代风格UI建模UI数据集
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 67%
生成式AI的角色如何影响人机协作工作中价值感知
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 67%
GANzilla:在生成对抗网络中实现用户驱动的方向发现
UIST '22· 生成式AI(文本、图像、音乐、视频) +1
- 67%
Knoll:为大型语言模型构建知识生态系统
UIST '25· 大语言模型(LLM)的人机协作 +1
- 60%
生成式人工智能的专业用户体验设计师的看法
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 60%
单元、生成器与透镜:面向大型语言模型面向对象交互的设计框架
UIST '23· 大语言模型(LLM)的人机协作
- 60%
Patchview:基于生成式尘埃与磁铁可视化的大型语言模型驱动世界构建系统
UIST '24· 生成式AI(文本、图像、音乐、视频) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642861
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
UI/UX 设计师、数据科学家与分析师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文