文本到图像实践社区研究:人们如何及为何提示生成式AI
荣誉提名随着能够从文本生成艺术图像的大型机器学习(ML)模型的普及,图像生成进入了主流。AI艺术爱好者在几个月内在线生成了数百万张图像,揭示了文本到图像(TTI)生成的社会、经济和法律后果。这项工作探索了这一尚未得到充分研究的现象背后的多面社会学和实践。我们旨在理解文本到图像从业者、他们的动机、实践以及他们面临的可及性挑战,以便设想与这项技术的创意和有意义交互。我们分析了两组数据:一份在社交媒体群组和DiffusionDB(发送至Stable Diffusion生成模型的用户文本提示的大型数据集)上收集的64名从业者在线问卷。问卷结果表明,TTI生成是一种来自狭窄社会职业群体的娱乐活动,其用户在平台之间及超越请求-响应交互的范围使用辅助技术。固有的模型限制和寻找合适的提示表述是他们的主要问题。对DiffusionDB数据集的分析为提示符指定符创建了分类法,以及一个能够识别未见提示语义内容的相应模型,进一步揭示了从业者如何构建TTI提示。最后,我们讨论了研究的创意支持设计和socio-technical意义。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 83%
Sketchforme:用于交互式应用的基于文本描述生成草图场景
UIST '19· 生成式AI(文本、图像、音乐、视频) +2
- 83%
StyleFactory:通过风格强度控制与评估实现图像创作中更好的风格对齐
UIST '24· 生成式AI(文本、图像、音乐、视频) +2
- 80%
GANravel: 在生成对抗网络中用户驱动的方向解缠
CHI '23· 生成式AI(文本、图像、音乐、视频) +1
- 80%
Artinter: 委托视觉艺术的人工智能驱动边界对象
DIS '23· 生成式AI(文本、图像、音乐、视频) +1
- 67%
“我不想感觉自己在60年代的工厂工作”:从业者对创意支持工具采用的看法
CHI '22· 生成式AI(文本、图像、音乐、视频) +1
- 67%
TypeDance:通过个性化生成从图像创建语义排版标志
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 67%
当团队拥抱AI时:创造性设计任务中生成性提示中的人机协作策略
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 67%
InkIdeator: 通过AI注入的中国画探索支持中国风格视觉设计构思
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 67%
生成式AI时代创意从业者的角色与工作流程演变
C&C '24· 生成式AI(文本、图像、音乐、视频) +1
- 67%
GANCollage:一种GAN驱动的数字情绪板以支持创意构思
DIS '23· 生成式AI(文本、图像、音乐、视频) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)