JustShape:探索多模态LLM驱动的3D参数化建模的协同手势

荣誉提名
手部手势识别生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作3D 建模与动画计算方法在HCI中的应用软件工程师与开发者UI/UX 设计师产品设计师HCI 研究员

文献标题

JustShape: Exploring Co-Speech Gestures for Multimodal LLM-Powered 3D Parametric Modeling

出版信息

  • 主题领域: 基于大型语言模型的多模态交互范式在3D参数化建模中的应用。
  • 关键词: 伴随语音手势、多模态交互、参数化建模、增强现实、大型语言模型、生成式设计、CAD、手势识别、用户研究、设计意图。

背景与问题

  • 问题/挑战: 传统的参数化建模方法需要较高的技术专业知识,导致用户意图与系统操作之间存在“执行鸿沟”。仅依赖文本的方式缺乏参数化建模所需的精确性,而基于手势的系统通常侧重于命令替代,而非基于意图的设计。
  • 重要性: 降低参数化建模的门槛可以使强大的设计工具更具普及性,让新手和具备身体表达能力的创作者无需大量培训即可参与3D建模任务。
  • 动机与相关工作: 先前的研究探索了基于GUI、编程和草图的建模方法,但这些方法需要结构化操作和技术熟练度。多模态大型语言模型(LLM)在其他领域已显示出弥合“执行鸿沟”的潜力,但在传达参数化建模所需的精确几何和空间属性方面仍面临挑战。

解决方案

  • 提出的方法: JustShape——一个多模态LLM驱动的系统,结合伴随语音手势和语音输入,在增强现实环境中生成参数化3D模型。
  • 创新点:
    1. 通过引导研究,识别语音与伴随语音手势在表达设计意图方面的协同作用。
    2. 开发多模态融合管道,将手势参数化并与语音结合以实现精确建模。
    3. 基于增强现实的原型系统,支持直观交互和参数化模型的迭代优化。
    4. 实证评估表明,与基线方法相比,该系统在几何精度和用户体验方面显著提升。
  • 流程与关键技术:
    • 进行引导研究,分类伴随语音手势及其与语音的协同作用。
    • 开发多模态融合管道,利用手势参数化函数和工具增强的LLM。
    • 在增强现实界面中实现迭代设计工作流,支持实时可视化、手势跟踪和参数化编辑。
    • 通过用户研究评估系统性能,将伴随语音手势与仅语音和草图+语音输入进行比较。

结果

  • 具体发现:
    • 与仅语音输入相比,伴随语音手势将几何精度提高了40.1%,与草图+语音输入相比,交互时间减少了47.3%。
    • 手势分类精度在六种形状属性中范围为82.2%到91.8%,其中基于轨迹的手势实现了最高的参数精度(81.4%)。
    • 多模态融合管道在提示质量(53.73 vs. 32.37)和几何保真度(Chamfer Distance: 35.21 vs. 70.64)方面显著优于基线系统。
  • 相较基线的优势:
    • 伴随语音手势在可用性、愉悦性和直观性方面优于草图+语音和仅语音方法。
    • 降低了认知负荷和心理需求,使新手设计师能够更有效地表达设计意图。
  • 实验/评估:
    • 用户研究1:比较伴随语音手势、仅语音和草图+语音输入在五种基本CAD操作中的表现。
    • 用户研究2:评估系统在封闭式和开放式建模任务中的可用性,SUS评分为80.16,表明系统可用性为“良好”到“优秀”。
  • 局限性与未来工作:
    • 当前系统支持中等复杂度模型,但尚不具备行业级设计能力。
    • 手势输入和增强现实系统可能导致疲劳或不适,需改进硬件。
    • 未来工作包括跨平台部署、与专家工作流的集成,以及将多模态输入扩展到更广泛的3D建模任务。

总结

JustShape引入了一种用于参数化建模的多模态交互范式,结合伴随语音手势和语音输入,降低了新手用户的使用门槛。该系统在增强现实界面中集成了手势参数化和多模态融合管道,支持直观的设计工作流。用户研究表明,与传统方法相比,该系统在几何精度、可用性和用户体验方面显著提升。尽管在延迟、鲁棒性和可扩展性方面仍面临挑战,JustShape为普及3D参数化建模并将具身设计实践与计算工具相结合迈出了重要一步。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222954/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790641
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
9 位作者
sell
研究子方向
手部手势识别、生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、3D 建模与动画
work
职业/产业
软件工程师与开发者、UI/UX 设计师、产品设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文