JustShape:探索多模态LLM驱动的3D参数化建模的协同手势
荣誉提名作者
手部手势识别生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作3D 建模与动画计算方法在HCI中的应用软件工程师与开发者UI/UX 设计师产品设计师HCI 研究员
文献标题
JustShape: Exploring Co-Speech Gestures for Multimodal LLM-Powered 3D Parametric Modeling
出版信息
- 主题领域: 基于大型语言模型的多模态交互范式在3D参数化建模中的应用。
- 关键词: 伴随语音手势、多模态交互、参数化建模、增强现实、大型语言模型、生成式设计、CAD、手势识别、用户研究、设计意图。
背景与问题
- 问题/挑战: 传统的参数化建模方法需要较高的技术专业知识,导致用户意图与系统操作之间存在“执行鸿沟”。仅依赖文本的方式缺乏参数化建模所需的精确性,而基于手势的系统通常侧重于命令替代,而非基于意图的设计。
- 重要性: 降低参数化建模的门槛可以使强大的设计工具更具普及性,让新手和具备身体表达能力的创作者无需大量培训即可参与3D建模任务。
- 动机与相关工作: 先前的研究探索了基于GUI、编程和草图的建模方法,但这些方法需要结构化操作和技术熟练度。多模态大型语言模型(LLM)在其他领域已显示出弥合“执行鸿沟”的潜力,但在传达参数化建模所需的精确几何和空间属性方面仍面临挑战。
解决方案
- 提出的方法: JustShape——一个多模态LLM驱动的系统,结合伴随语音手势和语音输入,在增强现实环境中生成参数化3D模型。
- 创新点:
- 通过引导研究,识别语音与伴随语音手势在表达设计意图方面的协同作用。
- 开发多模态融合管道,将手势参数化并与语音结合以实现精确建模。
- 基于增强现实的原型系统,支持直观交互和参数化模型的迭代优化。
- 实证评估表明,与基线方法相比,该系统在几何精度和用户体验方面显著提升。
- 流程与关键技术:
- 进行引导研究,分类伴随语音手势及其与语音的协同作用。
- 开发多模态融合管道,利用手势参数化函数和工具增强的LLM。
- 在增强现实界面中实现迭代设计工作流,支持实时可视化、手势跟踪和参数化编辑。
- 通过用户研究评估系统性能,将伴随语音手势与仅语音和草图+语音输入进行比较。
结果
- 具体发现:
- 与仅语音输入相比,伴随语音手势将几何精度提高了40.1%,与草图+语音输入相比,交互时间减少了47.3%。
- 手势分类精度在六种形状属性中范围为82.2%到91.8%,其中基于轨迹的手势实现了最高的参数精度(81.4%)。
- 多模态融合管道在提示质量(53.73 vs. 32.37)和几何保真度(Chamfer Distance: 35.21 vs. 70.64)方面显著优于基线系统。
- 相较基线的优势:
- 伴随语音手势在可用性、愉悦性和直观性方面优于草图+语音和仅语音方法。
- 降低了认知负荷和心理需求,使新手设计师能够更有效地表达设计意图。
- 实验/评估:
- 用户研究1:比较伴随语音手势、仅语音和草图+语音输入在五种基本CAD操作中的表现。
- 用户研究2:评估系统在封闭式和开放式建模任务中的可用性,SUS评分为80.16,表明系统可用性为“良好”到“优秀”。
- 局限性与未来工作:
- 当前系统支持中等复杂度模型,但尚不具备行业级设计能力。
- 手势输入和增强现实系统可能导致疲劳或不适,需改进硬件。
- 未来工作包括跨平台部署、与专家工作流的集成,以及将多模态输入扩展到更广泛的3D建模任务。
总结
JustShape引入了一种用于参数化建模的多模态交互范式,结合伴随语音手势和语音输入,降低了新手用户的使用门槛。该系统在增强现实界面中集成了手势参数化和多模态融合管道,支持直观的设计工作流。用户研究表明,与传统方法相比,该系统在几何精度、可用性和用户体验方面显著提升。尽管在延迟、鲁棒性和可扩展性方面仍面临挑战,JustShape为普及3D参数化建模并将具身设计实践与计算工具相结合迈出了重要一步。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790641
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
9 位作者
sell
研究子方向
手部手势识别、生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、3D 建模与动画
work
职业/产业
软件工程师与开发者、UI/UX 设计师、产品设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文