是AI还是我?理解用户使用文本到图像生成AI工具的提示旅程

生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作UI/UX 设计师数据科学家与分析师AI/ML 研究员与工程师

文献标题

Is It AI or Is It Me? Understanding Users’ Prompt Journey with Text-to-Image Generative AI Tools

文献信息

  • 主题领域: 人机交互、生成式人工智能、用户体验研究
  • 关键词: 提示工程, 生成式AI, 文本到图像生成, 用户旅程, 人机交互, 创造力工具, Midjourney, AI提示优化

研究背景与问题

  • 发现的问题或挑战:

    • 文本到图像生成工具(如Midjourney)的用户在设计提示(prompts)时往往不能直接实现其设计目标,提示的复杂性和多样化仍是用户使用中的主要阻碍。
    • 当前关于提示指南、手册以及“提示工程”研究大多过于理论化,未完全考虑到用户的真实目的和实践挑战。
    • 生成式AI输出与用户目标之间存在错位,且用户需克服技术学习曲线来提高工具的有效使用。
  • 重要性与动机:

    • 生成式AI在创意领域(如图形设计、建筑设计等)的应用逐步广泛,深入理解用户如何直观地设计提示对于完善工具设计至关重要。
    • 透视用户编写、评估和优化提示过程的具体案例,将有助于更好地匹配工具能力与用户的创造性目标,同时推动生成式AI工具的用户教育及社区参与。
  • 研究问题:

    1. 用户在文本到图像生成工具中的典型提示设计过程是什么?
    2. 用户在提示设计过程中存在哪些主要障碍?

解决方案

  • 方法或解决方案:

    • 通过半结构化访谈,研究了19位Midjourney用户的提示设计过程及挑战。
    • 提出“一种用户提示旅程模型”,该模型包含提示结构设计、图像评估和提示精炼三个阶段的具体策略。
  • 创新点:

    • 提炼了五种常见的提示结构:描述性句子、模板、概览+细节、分段模式以及单词序列。
    • 阐明了用户如何根据各阶段的目标与内容类型来评估及优化生成图像。
    • 发现了用户提示创作既是个人行为又是社交协作行为,强调了“协作提示创作”和“提示学习”在生成式AI社区中的作用。
  • 实施步骤及技术:

    • 访谈过程分为两个阶段:用户背景调查及提示和生成案例的回放分析。
    • 数据分析采用主题分析法,通过归纳整理访谈内容提炼出模式与挑战。
    • 使用Midjourney生成图像工具,分析其输入输出流程及用户对提示优化的策略。

研究成果

  • 具体成果:

    • 提示结构: 五种提示结构策略的特征与适用场景(如“描述性句子”适合新手,“分段模式”提供对细节的更高掌控力等)。
    • 评估标准: 生成图像的评估标准主要分为内容物和视觉设计两个层面,包括真实感、细节、颜色、构图等指标。
    • 优化策略: 用户采用的提示优化方法包括增加描述词、移除不必要词语、改变词序、调整权重参数以及重新生成等流程。
  • 与现有方案的比较:

    • 将用户的提示旅程与社区学习相结合,将交互行为视作内在个体体验的探索和外在社交学习的扩展,在文献中有新颖意义。
    • 研究不仅停留于理论建模,而是深度挖掘了用户的现实操作与心理。
  • 实验或评估结果:

    • 提示旅程是一个动态的迭代过程,用户的目标在创作过程中会不断调整。
    • 不同经验级别的用户面临的阻碍不同,初学者更多依赖随机生成,而熟练者更倾向于控制提示结构。
  • 局限性与未来方向:

    • 局限性:
      1. 本研究仅聚焦于Midjourney工具,未覆盖其他类似生成式AI工具的提示模式差异。
      2. 访谈对象来自单一语言和文化背景,未能反映跨文化使用场景。
    • 未来方向:
      1. 深入研究不同生成式AI工具下的提示模式对比。
      2. 扩展研究范围,包含更多元背景及跨文化用户。
      3. 探讨社区驱动的“提示学习”系统如何影响用户创造力及工具改进。

总结

通过详细的用户访谈分析,本研究揭示了Midjourney用户在提示结构设计、图像评估及优化过程中的策略与挑战,为生成式AI工具的人本设计提供了重要指引。这一研究为未来开发更智能、个性化和用户友好的文本到图像生成系统奠定了理论基础。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/146973/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642861
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
UI/UX 设计师、数据科学家与分析师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文