ADCanvas:为失明和低视力创作者打造的可访问对话式音频描述创作工具
语音可访问性AI 辅助创意写作AI辅助写作与文本生成辅助技术专家UI/UX 设计师HCI 研究员
文献标题
ADCanvas: Accessible and Conversational Audio Description Authoring for Blind and Low Vision Creators
出版信息
- 主题领域: 面向盲人和低视力(BLV)创作者的无障碍音频描述(AD)工具。
- 关键词: 音频描述,无障碍,盲人和低视力,多模态模型,会话代理,人机协作,屏幕阅读器,创意工具,视频创作,无障碍设计。
背景与问题
- 问题与挑战: 现有的音频描述(AD)工具主要为视力正常的用户设计,依赖时间轴和波形编辑器等视觉界面。这些工具对BLV创作者来说不可访问,迫使他们依赖视力正常的合作者,从而限制了他们的创作自主性。
- 重要性: 音频描述对于BLV观众访问视觉媒体至关重要,使BLV创作者能够独立制作音频描述有助于增强媒体制作中的包容性和代表性。
- 动机与相关研究: 之前的研究探索了半自动化音频描述工具和社区驱动平台,但这些主要服务于视力正常的创作者或消费者。多模态大语言模型(MLLMs)为无障碍音频描述创作提供了潜力,但其在BLV创作者的非视觉工作流程中的整合仍未被深入研究。
解决方案
- 提出的方法: ADCanvas是一种多模态音频描述创作工具,结合会话式人工智能、基于键盘的导航和支持屏幕阅读器的编辑器,使BLV创作者能够独立创建和完善音频描述脚本。
- 创新性:
- 引入了一种支持屏幕阅读器的音频描述创作工具,集成了会话式交互、视觉问答(VQA)和带时间戳的脚本编辑功能。
- 基于对12位BLV参与者的用户研究,揭示了人机协作创作实践和挑战。
- 提出了无障碍创意工具的设计启示,强调可配置性、精确性和非视觉交互。
- 流程与关键技术:
- 用户通过会话代理提问视觉问题、生成摘要并起草音频描述脚本。
- 基于WebVTT的编辑器支持带时间戳的脚本编辑,并兼容屏幕阅读器。
- 热键实现非视觉导航和播放控制。
- 实时文本转语音(TTS)旁白支持质量控制和与视频内容的同步。
结果
- 具体发现:
- 12位参与者中有10位将ADCanvas评价为“非常有用”(7/7),11位参与者表示使用意愿为7/7。
- 会话代理准确回答了89.1%的问题,10.9%的回答存在错误或不准确。
- 相较基线的优势:
- 使BLV创作者能够独立进行音频描述创作,无需依赖视力正常的合作者。
- 将视觉问答、脚本生成和编辑整合到一个无障碍工作流程中。
- 实验与评估:
- 通过三段短视频进行实验,这些视频代表了不同的音频描述创作挑战(质量控制、脚本引导创作和自由创作)。
- 数据通过“边思考边操作”协议、交互日志和会后访谈收集。
- 局限性与未来工作:
- 仅限于短视频和对话较少的视频;未来工作应包括对话丰富和较长的视频。
- 不支持高级功能,如波形检查或精细时间对齐。
- 未来研究应探索长期部署、协作工作流程以及在不同类型和制作角色中的扩展。
总结
ADCanvas是一种新颖的无障碍音频描述创作工具,通过会话式人工智能、屏幕阅读器兼容性和基于键盘的导航,赋能BLV创作者独立创建、完善和控制音频描述脚本。基于12位BLV参与者的用户研究表明,该工具在支持创意工作流程方面效果显著,获得了高评价的实用性和使用意愿。尽管该系统成功解决了音频描述创作中的无障碍障碍,未来工作应重点关注高级功能、定制化和更广泛的部署,以增强其在不同场景中的适用性。ADCanvas代表了迈向包容性媒体制作的重要一步,使BLV创作者能够发挥创意自主性和独立性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791158
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
语音可访问性、AI 辅助创意写作、AI辅助写作与文本生成
work
职业/产业
辅助技术专家、UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文