WorldScribe:面向情境感知实时视觉描述的系统

最佳论文
智能语音助手(Alexa、Siri 等)视觉障碍者技术(屏幕阅读器、触觉图形、盲文)

自动化实时视觉描述可以帮助盲人理解周围环境,实现自主和独立。然而,提供丰富、情境化且及时的描述一直是无障碍领域的长期挑战。在本工作中,我们开发了WorldScribe系统,用于生成自动化的实时真实世界视觉描述,可根据用户情境进行定制和自适应:(i) WorldScribe的描述根据用户意图定制,并基于语义相关性进行优先级排序。(ii) WorldScribe可适应视觉情境,例如为动态场景提供连续简洁的描述,而为稳定环境提供更长的详细描述。(iii) WorldScribe可适应声音情境,例如在嘈杂环境中增加音量,或在对话开始时暂停。WorldScribe由一套视觉、语言和声音识别模型驱动,引入了一个描述生成 pipeline,在丰富度和延迟之间做出权衡以支持实时使用。WorldScribe的设计基于先前提供视觉描述的研究以及与盲人参与者的形成性研究。我们的用户研究及后续的pipeline评估表明,WorldScribe可以提供实时且相当准确的视觉描述,以促进对环境的理解,且该描述可适应和定制到用户情境。最后,我们讨论了使实时视觉描述更加情境化和人性化的意义及进一步步骤。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/uist/170940/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3654777.3676375
一眼看懂

论文快照

fact_check
dataset
来源
UIST
calendar_month
年份
2024
emoji_events
奖项
最佳论文
group
作者
3 位作者
sell
研究子方向
智能语音助手(Alexa、Siri 等)、视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
article
内容状态
仅摘要
hub
相关论文
1 篇相关论文