GenPara: 通过使用文本条件形状参数推断用户感兴趣区域来增强3D设计编辑过程
生成式AI(文本、图像、音乐、视频)3D 建模与动画创意协作与反馈系统UI/UX 设计师产品设计师视觉艺术家与设计师
研究背景与问题
- 问题或挑战: 在3D设计中,仅通过文本指定设计目标和可视化复杂形状存在重大困难。这种复杂性源于3D设计的空间和结构复杂性,导致文本描述难以标准化且会因个人理解而异。尽管3D生成性人工智能(GenAI)在部件装配和高质量3D设计生成方面有进展,其对形状参数的动态生成和编辑支持仍然不足。此外,目前的GenAI系统常忽视设计探索和明确化过程中必要的迭代和细腻特性。
- 重要性: 像3D设计这样需要细腻视觉表达的领域,若无法通过有效方法链接抽象目标和具体实现,设计师的创造力和效率很可能受限。支持形状参数生成和与设计空间的交互性系统有潜力提升设计探索的创造性、效率和理解性。
- 研究动机与相关工作: 现有文献关注于3D形状的分解与操作,以及通过GenAI生成或优化设计,但未充分支持迭代细腻的探索过程。本研究以此为起点,提出通过富文本描述条件的形状参数,改进设计探索的效率和深入性。
解决方案
- 方法与解决方案: 提出GenPara,一个交互式3D设计编辑系统,通过富文本条件的形状参数和面向部件的推断方法(例如:贝叶斯推断)支持用户设计,并设计了Exploration Map(用于展示设计空间)和Design Versioning Tree(捕捉设计变化的层级结构)。
- 创新之处: 系统结合了以下创新:
- 利用细调的大型语言模型(LLM)解析复杂3D设计形状参数并与文本对齐。
- 用贝叶斯推断确定用户兴趣区域(Regions of Interest, ROI)并生成与用户目标一致的设计替代方案。
- 提供视觉化工具(Exploration Map和Design Versioning Tree),让设计师能够高效交互、探索和跟踪复杂形状参数的变化。
- 实施步骤与技术:
- 使用SALAD和SPAGHETTI模型实现3D部件拆解与生成。
- 通过UMAP降维展示设计参数的空间分布,用贝叶斯推断优化用户兴趣区域。
- 通过LLM生成文本条件下的形状参数并进一步调整目标设计。
- 提供文本输入框、探索地图和设计版本树的用户界面,以支持交互性和总结设计变化。
研究成果
- 具体成果:
- 通过训练LLM提取文本条件下的复杂形状参数,生成可替代的设计形状。
- 构建了一个互动系统,能帮助设计师理解并使用形状参数来表达设计目标。
- 在任务具体化和形状探索中取得重大改进。
- 比较优势:
- 与传统基于文本的生成系统(如聊天机器人或图像生成模型)相比,GenPara通过更直观、可视化和结构化的方式,更有效地帮助设计师理解和逐步细化设计形状。
- 设计版本树支持设计过程的全局追踪,从而系统性地组织迭代与变化。
- 实验或评估结果:
- 用户研究(N=16)显示,与基础系统相比,GenPara降低了用户提示的难度,增强了文本与形状参数间关系的可视化。
- 使用NASA-TLX工作负荷量表与Creativity Support Index,用户表示更高的设计满意度、更少的挫折感和更高的创意支持。
- 系统互动时间显著延长,但提示生成次数减少,说明用户花更多时间深入探索和具体化设计。
- 局限性与未来方向:
- 当前局限于椅子等部分类别的3D模型生成。未来研究需扩展到其他领域(如汽车、建筑等),并提升LLM对于复杂多类别设计的适应能力。
- Gaussian blob的表示方式对高度异形或需要精细调整的任务效果有限,未来可探索与语义标签更好结合的方式。
- 在支持协作设计方面仍有改进空间,例如多设计师交互或多属性整合等。
通过结合形状参数的可控生成与全面的可视化工具,GenPara为3D设计师提供了一种创新方法,同时为3D GenAI在设计流程中的应用指明了新方向。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3lightbulb
现实痛点
1- 设计师难以通过文本描述精确表达3D设计目标并探索复杂形状。分类: 生成式3D内容与编辑同类问题arrow_forward
- 83%
“我不想感觉自己在60年代的工厂工作”:从业者对创意支持工具采用的看法
CHI '22· 生成式AI(文本、图像、音乐、视频) +1
- 83%
神经画布:通过集成3D草图和生成式AI支持风景设计原型
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 83%
GANCollage:一种GAN驱动的数字情绪板以支持创意构思
DIS '23· 生成式AI(文本、图像、音乐、视频) +1
- 83%
ImaginationVellum:带空间提示、生成笔触和构思历史的生成式AI构思画布
UIST '25· 生成式AI(文本、图像、音乐、视频) +1
- 71%
FashionQ:一种促进时尚设计创意构思的人工智能驱动支持工具
CHI '21· 生成式AI(文本、图像、音乐、视频) +2
- 71%
利用生成式AI打造创意专长:图形界面在设计空间探索中比文本提示更好地支持创意构思
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
探索用于抽象驱动的探索性图像着色的交互式颜色调板
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
IntuModels:通过创意生成与选择实现面向初学者的交互式建模
C&C '21· 生成式AI(文本、图像、音乐、视频) +2
- 71%
DesignPrompt:利用多模态交互进行生成式AI设计探索
DIS '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
MemoVis:基于生成式人工智能的3D设计反馈伴侣参考图创建工具
UIST '24· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713502
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、3D 建模与动画、创意协作与反馈系统
work
职业/产业
UI/UX 设计师、产品设计师、视觉艺术家与设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文