天空才是极限:理解生成式AI如何提升屏幕阅读器用户在生产力应用中的体验
生成式AI(文本、图像、音乐、视频)视觉障碍者技术(屏幕阅读器、触觉图形、盲文)辅助技术专家HCI 研究员
研究背景与问题
-
问题与挑战:
- 盲人用户在使用生产力应用(如文字处理、电子表格和演示工具)时面临显著的可访问性和可用性挑战。
- 使用屏幕阅读器(SR)的用户经常难以管理视觉信息(例如图表和图形)、获得内容概览、寻找文档中的特定信息,以及与他人协作。
- 大量功能(如导航、控件访问和文档格式化)对盲人用户存在可访问性问题,这使盲人用户执行生产力任务的效率低于有视觉的同事。
-
重要性:
- 在工作、教育以及个人场景中,这些工具已成为现代生活不可或缺的一部分。提升其可访问性对于平等就业机会、教育水平提升及增强独立性至关重要。
- 随着生成式AI(Generative AI, GenAI)的技术发展,有可能为盲人提供自然语言交互和上下文任务理解,从而缓解这些问题。
-
研究动机与相关工作:
- 虽已有研究探讨盲人用户如何使用虚拟助手(如Siri、Alexa)完成简单任务,但研究重点偏向形象描述和简单操作,而对生产力相关任务的潜在改善研究较少。
- 虽然个别研究探讨了生产力工具中的某些具体问题,但对于盲人在这些应用中面临问题的全面理解,以及如何优先解决这些问题的研究仍然不足。
解决方案
-
方法与创新:
- 通过对99名使用屏幕阅读器的盲人用户进行调研,并与16名用户进行深入访谈,研究生成式AI如何提升用户体验。
- 探讨盲人对生成式AI的态度、潜在用例(如访问图形内容、提取信息、提供任务建议),并分析生成式AI引入后的信任、隐私和工作流集成问题。
- 提出生成式AI的设计思路,使其与现有SR工作流相辅相成,而不是替代。
-
关键技术:
- 任务辅助:通过自然语言生成内容描述(如图表解释),或在请求下直接执行特定任务(如表格排序)。
- 信息提取:支持用户从长文档中总结信息、提取结构化数据。
- 个性化集成:探索生成式AI与屏幕阅读器的结合、系统级或应用内的适配方法。
-
实施步骤:
- 调查界定盲人用户的主要痛点,以及在现有生产力应用中最亟待解决的问题。
- 对生成式AI的潜在功能进行用户测试和收集反馈,以定义它如何支持现有的用户工作流。
- 探索如何以混合主动权(Mixed-initiative)的模式满足需求,即让用户自主决定何时干预和何时由AI处理任务。
研究成果
-
主要结论:
- 生成式AI被认为是盲人用户的强大辅助工具,可提升任务的效率并在无须依赖他人帮助的情况下完成复杂任务。
- 用户认为AI可以显著改善以下方面:可访问内容、编辑与格式化、导航效率、协作时对变更的理解。
- AI还可支持用户通过键盘快捷键学习SR的高级操作,提升独立性。
-
与现有解决方案的对比:
- 相比传统SR和其他辅助工具,生成式AI进一步提升了盲人用户的生产力和信息获取能力。特别是对于处理不可访问的内容(如转化为更加易用的格式),生成式AI独具优势。
-
实验或评估结果:
- 调查结果表明,受访用户对生成式AI的应用表现出广泛的兴趣和积极态度,尤其是在减少完成任务所需时间以及使盲人用户能够更独立地操作生产力应用方面。
- 访谈进一步明确了用户对生成式AI交互风格的多样化需求(如语音与文本输入结合)。
-
局限性与未来方向:
- 局限性:
- 当前盲人用户对生成式AI的认知和使用经验仍处于初期阶段,未来可能会随技术的成熟和应用场景的扩展而变化。
- 调研参与者主要来自英语国家,教育程度相对较高,可能未全面反映全球盲人群体的需求。
- 未来方向:
- 进一步验证生成式AI对盲人用户的长远影响,特别是在职业环境中的实际应用。
- 集成盲人用户反馈和更多非英语地域用户的需求,改善AI模型的训练数据并设计专门的个性化功能。
- 开发可解释性强的AI任务输出反馈机制,以及用于验证信息正确性的工具以增强用户信任。
- 局限性:
通过此研究,可以更好地指导生产力软件和辅助技术设计者开发更具包容性的解决方案,从根本上改善盲人用户的数字化参与体验。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 盲人在使用生成式AI(如自然语言描述和内容提取)辅助生成内容时,实际有哪些挑战和需求?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 生成式AI如何与屏幕阅读器结合,以增强盲人处理文档的效率?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 如何设计生成式AI的互操作功能,以便盲人能在不完全替代屏幕阅读器的情况下获得支持?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
lightbulb
现实痛点
1- 盲人难以高效使用文档工具处理图表或协同任务。分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 100%
与AI进行社交意义构建:为盲童设计一个开放式的AI体验
CHI '21· 生成式AI(文本、图像、音乐、视频) +1
- 100%
GenAssist:使图像生成更具可访问性
UIST '23· 生成式AI(文本、图像、音乐、视频) +1
- 75%
Twitter A11y:一个使Twitter图片可访问的浏览器扩展
CHI '20· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
- 75%
日常不确定性:盲人如何使用生成式人工智能工具获取信息
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 67%
从来源到异常:图像创建者和屏幕阅读用户对AI生成图像的替代文本的观点
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 67%
利用生成式AI创作残障故事视频:动机、表达与分享
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 60%
为屏幕阅读器用户丰富视觉内容的表示
CHI '18· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文) +1
- 60%
用舌头阅读:个体差异影响BrainPort对模糊刺激的感知
CHI '20· 振动反馈与皮肤刺激 +1
- 60%
介绍游戏信息控制框架:为视觉障碍人士提供数字游戏访问
CHI '20· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文) +1
- 60%
改进颜色图案以帮助色觉缺陷人士
CHI '22· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713634
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
辅助技术专家、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文