走向抽象:协作物理任务中的多模态约定形成
作者
全身交互与体感输入眼动追踪与注视交互AR 导航与情境感知物理-数字混合交互UI/UX 设计师AI/ML 研究员与工程师HCI 研究员
文献标题
Gesturing Toward Abstraction: Multimodal Convention Formation in Collaborative Physical Tasks
出版信息
- 主题领域: 多模态通信与协作性物理任务中的约定形成。
- 关键词: 多模态通信、约定形成、增强现实、手势、语言、协作组装、抽象、理性语言行为、计算建模、人机交互。
背景与问题
- 问题/挑战: 以往研究主要集中于单模态或二维协作任务,尚未充分理解多模态通信在重复性物理协作中的演变过程。在迭代的多步骤物理任务中对多模态约定进行建模的研究较为有限。
- 重要性: 理解多模态通信的演变对于设计能够与人类形成约定并高效协作的智能代理至关重要,尤其是在物理环境中。
- 动机与相关工作: 先前研究表明,人们在重复互动中会形成临时约定,使用简洁且抽象的表达。然而,大多数研究集中于单模态,关于多模态通信(语言和手势)在物理任务中的动态变化仍未被充分探索。本研究基于以往工作,探讨多模态信号的演变,并对这些变化进行计算建模。
解决方案
- 提出的方法: 本研究通过两项研究(单模态在线研究和基于增强现实的多模态实验室研究)探讨语言和手势约定如何在协作性物理任务中形成,并提出一种扩展理性语言行为(RSA)框架至多模态环境的计算模型。
- 创新点:
- 进行了一项大规模在线单模态研究和一项受控的基于增强现实的多模态实验室研究。
- 开发了一个用于重复性物理协作任务的多模态数据集。
- 提出了一种计算模型,捕捉多模态通信中的抽象形成和模态偏好。
- 研究流程与关键技术:
- 单模态研究: 参与者在积木组装任务中协调语言抽象,从积木层级描述逐步转向塔层级描述。
- 多模态研究: 参与者在增强现实介导的物理组装任务中使用语言和手势,形成约定并随着时间调整模态使用。
- 计算模型: 将RSA框架扩展至多模态环境,纳入抽象映射模糊性、表达模糊性和模态偏好。模拟研究中观察到的抽象形成和模态转变。
结果
- 具体发现:
- 在单模态研究中,重建准确率从F1 = 0.88提高到F1 = 0.98,指令长度在重复过程中减少了50%。
- 在多模态研究中,任务成功率从74.03%提高到98.36%,指令和组装时间显著减少。
- 参与者在早期引入塔层级抽象,并通过语言和手势的冗余强调位置和方向的变化。
- 相较基线的优势:
- 展示了多模态通信(语言和手势)比单模态通信更有效,冗余提高了理解和效率。
- 计算模型成功模拟了抽象形成和模态偏好变化,与实证结果一致。
- 实验/评估:
- 单模态研究: 146名参与者(73对二人组)完成了12轮积木组装任务,分析了语言抽象和效率。
- 多模态研究: 40名参与者(20对二人组)完成了基于增强现实的物理组装任务,分析了语言和手势的抽象、冗余和模态转变。
- 评估指标包括任务准确率、指令长度、抽象层级和模态使用。
- 局限性与未来工作:
- 仅限于简单积木塔;未来研究应探索更复杂的物理结构(如家具组装)。
- 回合制协议限制了实时动态;未来研究应考察同步通信。
- 计算模型假设(如均匀先验、完美对齐)需进一步优化以适应实际应用。
总结
本文研究了多模态通信(语言和手势)在重复协作性物理任务中的演变过程。通过在线单模态研究和增强现实介导的多模态研究,发现参与者会形成语言和手势约定,从积木层级转向塔层级抽象,并通过冗余强调变化。扩展理性语言行为框架的计算模型捕捉了这些行为,模拟了抽象形成和模态偏好。这些发现为设计能够学习并适应用户多模态抽象和通信偏好的约定感知智能代理提供了重要启示,特别是在物理组装任务中。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790618
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
全身交互与体感输入、眼动追踪与注视交互、AR 导航与情境感知、物理-数字混合交互
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文