利用涂鸦和注释增强生成式人工智能图像细化:多模态提示的比较研究
作者
生成式人工智能(GenAI)图像工具在设计实践中越来越多地被使用,能够实现快速构思,但在调整布局、比例或视觉属性等细化任务中提供的支持有限。虽然文本提示和图像修复允许局部编辑,但对于精确、情境内和迭代的细化来说,它们往往仍然效率低下或含糊不清——这促使我们探索替代方法。这项工作研究了基于笔的涂鸦和注释如何增强GenAI图像细化。与七名专业设计师进行的形成性研究 informing 了一个支持三种输入模态的原型:纯文本、纯视觉和组合提示。一项由30名设计师和设计学生参与的被试内研究比较了这些模态在封闭和开放任务中的表现,评估了表达性、效率、工作量、用户体验、迭代和多模态策略。视觉提示提高了空间编辑的清晰度和速度,同时减少了工作量,而文本在语义和全局更改方面仍然有效。组合模态获得整体最高评分,实现了互补使用,平衡了空间精度与语义细节,并支持更顺畅的迭代。任务特定偏好也出现了:添加新对象通常需要两种模态,而移动或修改元素通常通过视觉输入处理。这项工作贡献了(1)GenAI细化多模态提示的经验比较,(2)集成涂鸦和注释的原型,以及(3)关于设计师多模态策略的见解,以 informs 未来更好支持GenAI支持的设计工作流中细化的GenAI界面。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 100%
DesignTrace:利用GenAI探索、迭代和追踪设计备选方案
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 83%
CreativeConnect: 利用生成式人工智能支持图形设计构思中的参考重组
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 83%
Brickify:通过设计令牌上的直接操作启用表达设计意图规范
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 83%
Iconix:在渐进式图标网格生成中控制语义与风格
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
FashionQ:一种促进时尚设计创意构思的人工智能驱动支持工具
CHI '21· 生成式AI(文本、图像、音乐、视频) +2
- 71%
利用生成式AI打造创意专长:图形界面在设计空间探索中比文本提示更好地支持创意构思
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
探索用于抽象驱动的探索性图像着色的交互式颜色调板
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
理解人类与AI代理之间的非线性协作:创意设计的共同设计框架
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
InspirationGraph:用于渐进式设计空间探索的交互范式
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
来自惊喜的创造力:弥合时装设计师灵感工作与AI创意支持工具的差距
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)