基于手势感知的交互式机器教学与原地物体标注

手部手势识别人体姿态与行为识别软件工程师与开发者HCI 研究员

文献标题

Gesture-aware Interactive Machine Teaching with In-situ Object Annotations

文献信息

  • 主题领域: 交互式机器学习、视觉交互、用户界面设计
  • 关键词: 交互式机器教学, 指示性手势, 实地标注, 数据集, 物体分割

研究背景与问题

  • 作者发现了哪些问题或挑战?

    • 现有的视觉交互式机器教学系统通常忽略了对目标物体的标注或需要用户在后续阶段进行标注,而这可能导致模型基于与目标物体无关的特征进行错误学习。
    • 后续阶段的标注增加了用户负担,降低了教学系统的可用性。
  • 为什么这个问题很重要?

    • 机器学习模型准确性和可信度的提升对非专业用户至关重要,特别是在实际应用中,避免错误识别有助于增强用户对模型的信任。
    • 减少用户的交互负担可以显著改善机器教学系统的用户体验。
  • 研究动机与相关工作

    • 指示性手势在用户指示物体时具有高度的相关性,可用来指导物体分割。
    • 现有研究已经探索了交互式机器教学系统和注释工具,但尚未将物体标注深度集成到教学过程。

解决方案

  • 作者提出了哪些方法或解决方案?

    • 提出了一个名为“LookHere”的视觉交互式机器教学系统,集成了基于用户指示性手势的实时物体分割和标注功能。
    • 开发了名为“HuTics”的数据集,包括2040张用户通过不同指示性手势指向目标物体的标注图像。
  • 该解决方案的创新之处是什么?

    • 在用户教学过程中实时生成物体高亮区域(即分割掩码),指导模型关注目标物体区域。
    • 将物体的实时分割信息纳入模型训练,实现了实地标注。
    • 提供了模型评估可视化工具(例如显著性图),帮助用户理解训练模型的特征重点。
  • 实施步骤使用了哪些关键技术?

    • 实时手部分割算法结合U-Net架构实现基于指示性手势的物体分割。
    • 使用重新优化的手部分割模型(基于LIP数据集)作为辅助特征。
    • 引入联合分类和分割等技术优化显著性图的生成。
    • 构建和发布HuTics数据集,用于训练物体分割模型。

研究成果

  • 取得了哪些具体成果?

    • “LookHere”显著减少了用户在模型创建过程中的时间成本(相比后续标注减少了约14.3倍)。
    • 使用“LookHere”创建的模型在目标物体分割准确性上显著优于传统教学系统(平均IoU提高至0.718)。
    • 用户对“LookHere”的高效性能和直观性表示满意。
  • 与现有解决方案相比,它有哪些优势?

    • 实现了无缝集成的教学与标注流程,消除了后续标注的负担。
    • 提供实时反馈(物体高亮区域),增强用户控制感和信心。
    • 性能评估显示,与后续标注相比性能相当,但大幅简化了用户交互。
  • 实验或评估结果是什么?

    • 用户可在短时间内创建准确性较高的模型,同时分割效果达到平均IoU为0.718。
    • NASA-TLX指标显示,与传统标注流程相比,LookHere在降低心理负担、身体负担和时间压力方面表现突出。
  • 局限性与未来方向

    • 当前系统在远距离指示或者3D场景理解方面存在一定问题,可考虑引入深度感知和3D场景重建技术。
    • 功能上缺乏主动纠正错误分割区域的支持;未来可以集成语音输入或其他主动标注功能。
    • 关于隐私问题,仅涉及用户活动捕捉,未来需要进一步研究平衡隐私保护与高效标注的设计。
    • 数据集有利于扩展至其他应用场景,例如虚拟背景、智能肖像模式和对视障用户的支持。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/85000/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3526113.3545648
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
手部手势识别、人体姿态与行为识别
work
职业/产业
软件工程师与开发者、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文