GenTune:面向可追溯提示词以提升环境设计中图像细化的可控性
作者
娱乐业环境设计师需要创建想象性的2D和3D场景,既要求对特定细节的精细控制,又要求全局一致性。设计师越来越多地将生成式AI集成到工作流程中,通常依赖大型语言模型扩展用户提示词进行文生图,然后迭代细化提示词并应用图像修复。然而,我们与10名设计师的形成性研究揭示了两个关键挑战:(1) 冗长的LLM生成提示词难以理解和隔离需要修改的特定视觉元素关键词;(2) 虽然图像修复支持局部编辑,但在全局一致性和正确性方面存在困难。基于这些见解,我们提出了GenTune,一种通过阐明AI生成的提示词如何映射到图像内容来增强人机协作的方法。GenTune系统让设计师选择生成图像中的任何元素,追溯到相应的提示词标签,并修改这些标签以指导精确且全局一致的图像细化。在与20名设计师的总结性研究中,相比当前实践,GenTune显著提升了提示词-图像理解、细化质量和效率以及整体满意度(p值均<.01)。与两个工作室的后续实地研究进一步证明了其在真实世界设置中的有效性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 100%
Jigsaw:通过连接AI基础模型支持设计师原型设计多模态应用程序
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 80%
探索支持设计师学习与基于AI的制造设计工具协同创造的挑战与机遇
CHI '23· 生成式AI(文本、图像、音乐、视频) +1
- 80%
人工智能辅助的人因设计因果路径图
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 80%
I-Card:一种由生成式AI支持的智能设计方法卡片集
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 80%
与人工智能设计构思——生成式机器学习模型的素描、思考与对话
DIS '23· 生成式AI(文本、图像、音乐、视频) +1
- 80%
PromptInfuser:AI与UI设计的紧密耦合如何影响设计师的工作流程
DIS '24· 大语言模型(LLM)的人机协作 +1
- 67%
可以使用AI吗?使用合作上下文强盗进行设计构思
CHI '19· 生成式AI(文本、图像、音乐、视频) +2
- 67%
ICONATE:自动复合图标生成与构思
CHI '20· 生成式AI(文本、图像、音乐、视频) +2
- 67%
PlantoGraphy:将迭代设计过程融入景观渲染的生成式人工智能
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 67%
IEDS: 探索结合设计师、AR和GAI的智能实体设计空间以支持工业概念设计
CHI '25· AR 导航与情境感知 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)