GenTune:面向可追溯提示词以提升环境设计中图像细化的可控性

生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作原型设计与用户测试UI/UX 设计师产品设计师

娱乐业环境设计师需要创建想象性的2D和3D场景,既要求对特定细节的精细控制,又要求全局一致性。设计师越来越多地将生成式AI集成到工作流程中,通常依赖大型语言模型扩展用户提示词进行文生图,然后迭代细化提示词并应用图像修复。然而,我们与10名设计师的形成性研究揭示了两个关键挑战:(1) 冗长的LLM生成提示词难以理解和隔离需要修改的特定视觉元素关键词;(2) 虽然图像修复支持局部编辑,但在全局一致性和正确性方面存在困难。基于这些见解,我们提出了GenTune,一种通过阐明AI生成的提示词如何映射到图像内容来增强人机协作的方法。GenTune系统让设计师选择生成图像中的任何元素,追溯到相应的提示词标签,并修改这些标签以指导精确且全局一致的图像细化。在与20名设计师的总结性研究中,相比当前实践,GenTune显著提升了提示词-图像理解、细化质量和效率以及整体满意度(p值均<.01)。与两个工作室的后续实地研究进一步证明了其在真实世界设置中的有效性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/206999/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3746059.3747774
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、原型设计与用户测试
work
职业/产业
UI/UX 设计师、产品设计师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文