驾驶员指向多模态融合:车内与车外物体指向对比研究
车内触觉、声音、多模态反馈手部手势识别语音用户界面(VUI)设计汽车制造商与车辆设计师自动驾驶工程师与测试员
文献标题
Multimodal Driver Referencing: A Comparison of Pointing to Objects Inside and Outside the Vehicle
文献信息
- 主题领域: 智能用户交互、驾驶员行为研究、手势与注视融合
- 关键词: 多模态融合、自然用户交互、注视追踪、头部姿态、手势识别
研究背景与问题
- 问题或挑战:
- 如何准确检测驾驶员的指向意图,无论目标是在车内还是车外。
- 单一模态(如眼动、头部姿态或手势)的指向行为受限,难以在不同情境中表现出稳定性。
- 现有技术对上诉问题的解决较少整合内外情境的差异。
- 重要性:
- 在自动驾驶和智能驾驶辅助领域,自然用户交互(Natural User Interaction, NUI)的发展可显著提升用户体验。
- 多模态交互(语音、注视、手势)有助于减少触摸式交互带来的分心风险。
- 研究动机与相关工作:
- 相关工作表明结合多种交互方式(如手势和语音)可以增强汽车内的交互自然性和精确性。
- 然而,对比车内与车外指向行为的研究匮乏,且大多集中于模拟实验,缺乏真实环境下的验证。
解决方案
- 方法或解决方案:
- 提出一种两阶段的多模态融合框架:
- 第一阶段:通过浅层卷积神经网络(CNN)来区分驾驶员的指向目标属于车内还是车外。
- 第二阶段:根据第一阶段的分类结果,应用合适的深层CNN模型进行多模态融合,推断驾驶员的指向方向。
- 使用语音作为触发器,以标记参考事件时间点。
- 多模态输入包含手指指向、眼动跟踪、头部姿态的空间位置和方向。
- 提出一种两阶段的多模态融合框架:
- 创新之处:
- 同时处理车内与车外目标的指向对比。
- 首次在真实车辆和环境中量化分析驾驶员指向行为。
- 提出一种多模态模型融合策略,基于深度学习显著提升指向精度。
- 实施步骤与技术细节:
- 数据采集:在真实车辆下对驾驶员使用无接触传感器(如手势相机和视觉相机)收集指向事件的数据,目标包括车内的12个区域和车外的5个地标。
- 特征提取:从手指端点、注视和头部姿态中提取3D空间位置和方向信息。
- 数据预处理:包括对缺失数据的线性插值处理和坐标轴归一化。
- 模型训练:使用基于笔者采集的数据集训练CNN模型,包括对类别区分和角度回归任务的优化。
- 实验设置:对每种单一模态、多模态组合,以及跨数据集的泛化能力进行测试和评价。
研究成果
- 具体成果:
- 使用所提框架,在车内车外目标区分中取得了98.6%的分类准确率。
- 多模态融合模型显著提升了指向方向预测的精度:
- 车内目标情况下,平均角度误差(MAD)从单模态的6.1°降至2.5°。
- 车外目标情况下,平均角度误差从9.3°(单模态)降至7°。
- 单模态和多模态对比显示:单纯使用某一模态(如注视或手势)无法在两种场景中均达到最佳效果,融合方法表现更优。
- 优势比较:
- 多模态融合在精度和命中率(Hit Rate)上均显著优于单模态。
- 框架能够真实环境下应对不同驾驶员行为的差异,且补偿了单一模态在受遮挡或缺失情况下的不足。
- 实验或评估结果:
- 单模态下的结果在车内与车外表现出显著差异,指向目标的距离和姿态变化对精度有重要影响。
- 在驾驶员个体差异分析中,融合结果的精度和命中率具有显著提升,但仍存在一些参与者在特定环境下表现较差的情况。
- 跨数据集学习验证了模型对特定环境条件的依赖性,联合训练虽然能够提升泛化能力,但会牺牲部分精确性。
- 局限性与未来方向:
- 局限性:
- 仅在静止车辆状态下进行实验,未涉及车辆动态变化对结果的可能影响。
- 模型仍然依赖于传感器数据的可靠性,例如手势失准可能显著影响识别精度。
- 未来方向:
- 在动态环境(移动车辆或驾驶中场景)中验证框架的有效性。
- 增加多模态融合中的更多语义信息,例如语音内容与背景上下文的结合。
- 探索个性化模型,适应不同驾驶员的行为模式和习惯。
- 局限性:
总结
本研究展示了基于多模态融合的自然交互系统如何精确预测驾驶员的指向目标,在提升智能驾驶体验方面具有重要意义和潜在应用价值。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 在车内和车外的目标指向行为中,司机是否表现出显著不同的指向模式?分类: 眼动、注视与指向目标选择同类问题arrow_forward
- 多模态融合(如手势、视线和头部姿态数据)能否提高驾驶员指向目标的预测准确性?分类: 眼动、注视与指向目标选择同类问题arrow_forward
- 哪些因素影响了在不同环境中,单一模态和多模态方法的指向预测性能?分类: 眼动、注视与指向目标选择同类问题arrow_forward
lightbulb
现实痛点
1- 司机在驾驶时很难通过自然手势准确与车载系统互动。分类: 眼动、注视与指向目标选择同类问题arrow_forward
- 80%
语音+触觉:用车内触觉触控板交互增强语音用户界面
CHI '20· 车内触觉、声音、多模态反馈 +1
- 80%
用于控制汽车用户界面中二进制、离散和连续输入的非语言听觉输入
CHI '20· 车内触觉、声音、多模态反馈 +1
- 80%
车内性能和分心:空中和触摸方向手势
CHI '23· 车内触觉、声音、多模态反馈 +1
- 80%
通过方向盘手势输入提升车内语音用户界面的交互
AutoUI '21· 车内触觉、声音、多模态反馈 +1
- 80%
新型车内手势交互:听觉显示与菜单生成接口的设计与评估
AutoUI '23· 车内触觉、声音、多模态反馈 +1
- 67%
关于车辆中语音和手势交互期望与担忧的定性研究
DIS '23· 车内触觉、声音、多模态反馈 +2
- 67%
母语与第二语言处理对情绪驾驶员情境意识、驾驶表现和主观感知的影响
AutoUI '21· 车内触觉、声音、多模态反馈 +2
- 67%
空中触觉反馈改善基于手势的汽车信息娱乐系统的内隐控制感与信任度:一项驾驶模拟器研究
AutoUI '24· 车内触觉、声音、多模态反馈 +2
- 60%
利用模板覆盖层降低车载触摸屏注意力需求
AutoUI '18· 车内触觉、声音、多模态反馈
- 60%
道路颠簸对车内触控交互的影响
AutoUI '18· 车内触觉、声音、多模态反馈
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3490099.3511142
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
车内触觉、声音、多模态反馈、手部手势识别、语音用户界面(VUI)设计
work
职业/产业
汽车制造商与车辆设计师、自动驾驶工程师与测试员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文