文献标题
Beyond Technical Metrics: Understanding the Gap Between AI Performance and Deaf User Experience in Chinese Natural Sign Language Generation
出版信息
- 研究领域: 人工智能生成手语的评估与聋人用户体验。
- 关键词: 人工智能生成手语, 聋人用户体验, 中文自然手语, 参与式设计, 无障碍技术, 认知负荷, 语言质量, 文化真实性。
背景与问题
- 问题/挑战: 当前针对人工智能生成手语的评估指标主要集中在技术基准上,但未能反映聋人用户的理解能力、认知负荷和文化真实性。这导致系统性能与实际可用性之间存在差距。
- 重要性: 弥合这一差距对于确保人工智能生成手语系统满足聋人用户的交流需求、提升无障碍性和包容性至关重要。
- 研究动机与相关工作: 以往研究依赖基于词汇和语序映射的方法,未能捕捉中文自然手语(CNSL)的空间语法和情境意义。评估范式由研究人员定义,限制了聋人用户在制定评估标准中的主动性。本研究基于参与式设计原则重新定义评估框架。
解决方案
- 提出的方法: 与聋人共同研究者共同开发的参与式评估框架,涵盖七个维度,优先考虑用户理解能力、认知负荷和文化真实性。
- 创新点:
- 开发了一个整合客观理解测试、主观测量和CNSL特定标准的七维评估框架。
- 发现了逆复杂性效应,即语言复杂性对人类手语者降低认知负荷,但对人工智能生成手语却增加认知负荷。
- 提供了包容性人机交互(HCI)的方法论见解,强调在评估开发中采用参与式设计。
- 流程与关键技术:
- 创建一个情景感知的CNSL生成原型,分为三个阶段:文本到HamNoSys、HamNoSys到姿态、姿态到视频合成。
- 与聋人共同研究者开展五次工作坊,迭代定义评估维度、量表和标准。
- 通过24名聋人参与者进行用户评估研究,使用盲测和随机化视频比较AI生成和人类手语。
结果
- 具体发现:
- AI生成视频在可理解性上得分较低(客观:24.5% vs. 人类37.6%;主观:AI 33.0% 差 vs. 人类34.4% 好)。
- AI生成视频的心理需求更高(平均38.3 vs. 人类27.9)。
- 接受度评分更倾向于人类手语(平均47.1 vs. AI 36.8)。
- 在语言质量维度(流利度、空间语法、非手动标记、表现力)上,人类手语始终优于AI生成手语。
- 相较基线的优势:
- 技术指标的改进(如符号准确率80.6%,SSIM 0.865)并未转化为更好的用户结果,突显技术基准与实际可用性之间的脱节。
- 实验/评估:
- 54个视频(27对人类-AI配对)涵盖陈述句、疑问句和否定句类型。
- 混合效应模型分析了七个维度的评分,揭示了显著的来源×句型交互效应。
- 定性访谈收集了用户对理解挑战和认知疲劳的反馈。
- 局限性与未来工作:
- 评估集中于单句而非扩展语篇。
- 研究基于一个原型,需通过其他模型验证。
- 招募偏向年轻、数字化参与度高的手语者,未来研究应包括更广泛的人群。
- 研究过程由听人研究者主导,未来工作应探索由聋人主导的研究结构。
总结
本研究揭示了人工智能生成CNSL视频的技术基准与聋人用户体验之间的差距。与聋人共同研究者共同开发的参与式评估框架揭示了传统指标忽视的维度——可理解性、认知负荷和文化真实性。用户评估表明,AI生成手语在复杂句型上系统性地劣于人类手语。研究结果强调了以聋人为中心的评估标准的必要性,并提出了改进手语生成系统的实际调整建议。未来工作应扩展评估至语篇级互动,跨架构验证,并优先考虑由聋人主导的研究过程。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791429
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)、听觉障碍者支持(字幕、手语、振动)、语音可访问性
work
职业/产业
语言治疗师与听觉学家、社区健康工作者、老年护理人员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文