迈向公平的美国手语教育:基于LLM反馈的自我中心立体传感与错误感知学习

听觉障碍者支持(字幕、手语、振动)运动障碍辅助输入技术语音可访问性生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作语言治疗师与听觉学家特殊教育教师精神科医生与心理咨询师

文献标题

Toward Scalable ASL Education: Egocentric Stereo Sensing with LLM Feedback for Error-Aware Learning

出版信息

  • 主题领域: 基于人工智能的美国手语(ASL)教育工具。
  • 关键词: ASL学习,第一视角立体感知,错误检测,大型语言模型,反馈生成,手语教育,人机交互,具身学习,AI教育学,可访问性。

背景与问题

  • 问题/挑战: 现有的ASL学习工具主要关注识别功能,而非提供结构化的纠正性反馈。学习者缺乏及时、个性化的反馈,尤其是针对手形、方向、位置和动作等手部参数。
  • 重要性: ASL对于聋人社区的交流和文化认同至关重要,但教育中的结构性障碍限制了有效学习资源的获取。需要可扩展的解决方案来弥补美国超过50万学习者在反馈方面的不足。
  • 动机与相关工作: 现有系统依赖于正面摄像头或可穿戴设备,这些设备要么笨重,要么无法捕捉三维空间细节。反馈机制通常是定性或二元的,缺乏教育学基础。本文基于第二语言习得理论(SLA)和ASL课程设计,开发一个能够提供参数特定、可操作反馈的系统。

解决方案

  • 提出的方法: 一个基于第一视角立体摄像头的ASL学习系统,集成了三维手部重建、多任务错误检测和基于LLM的反馈生成。
  • 创新点:
    1. 首次引入专家监督的反馈库,为ASL训练提供指导。
    2. 开发一个端到端的第一视角立体ASL学习系统,结合感知、错误检测和结构化LLM提示。
    3. 通过与ASL教师和学习者的形成性研究验证设计目标的实证基础。
    4. 在初步可行性评估中展示了技术和教育学的稳健表现。
  • 流程与关键技术:
    • 使用头戴式立体摄像头进行第一视角三维手部重建。
    • 基于Transformer模型的多任务错误检测,涵盖手形、方向、位置和动作等手部参数。
    • 基于GPT-4生成结构化反馈,反馈内容根据参数特定的错误信号进行条件化。
    • 通过置信度门控抑制不确定检测,减少反馈中的虚假信息。

结果

  • 具体发现:
    • 视频级成功率(V-SR)为79.14%,误报率(FPR)为5.93%。
    • 教师标记错误的反馈覆盖率为80.10%,虚假反馈率为5.63%。
    • 评分级指标显示高稳定性,方向错误≤20°的准确率为90.1%,位置错误≤10 cm的准确率为89.2%。
  • 相较基线的优势:
    • 与2D单视图、正面视图、基于规则和零样本GPT基线相比,显著减少了虚假反馈。
    • 在所有手部参数上表现出更高的召回率和更低的误报率。
  • 实验/评估:
    • 两项研究:包括45名参与者(15名教师,30名学习者)的形成性需求评估,以及13名聋人参与者练习230个手语的系统评估。
    • 评估指标包括评分级稳定性、视频级一致性以及反馈级覆盖率/虚假反馈。
    • 消融实验强调了立体感知、多任务检测头和置信度门控的重要性。
  • 局限性与未来工作:
    • 当前评估为短期研究,仅限于手部参数,未集成面部表情等非手部标记。
    • 样本量较小,缺乏长期研究,限制了普适性。
    • 未来工作包括针对面部线索的多视图感知、更大规模的部署以及与多样化ASL课程的对齐。

总结

本文提出了一个基于第一视角立体ASL学习系统,通过AI驱动技术提供结构化、参数特定的反馈。该系统通过结合三维感知、错误检测和基于LLM的反馈生成,填补了ASL教育中的空白。与聋人参与者的评估显示出技术表现的稳健性、高反馈可靠性以及与教师判断的一致性。尽管目前仅限于手部参数和短期研究,该系统为可扩展、文化基础的ASL教育奠定了基础,并为AI驱动的具身技能学习提供了可转移的设计原则。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/221911/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790774
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
10 位作者
sell
研究子方向
听觉障碍者支持(字幕、手语、振动)、运动障碍辅助输入技术、语音可访问性、生成式AI(文本、图像、音乐、视频)
work
职业/产业
语言治疗师与听觉学家、特殊教育教师、精神科医生与心理咨询师
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文