help研究问题图表图像与视觉内容可访问性
多模态视觉-语言模型(VLMs)在图形用户界面(UI)任务中的表现为何较差?所属方向: 无障碍与辅助技术
图表图像与视觉内容可访问性
统计基于当前已索引 question 数据,来源缺失不影响问题展示。
117
问题/痛点
30
来源
2025
最近年份
help研究问题图表图像与视觉内容可访问性
如何针对UI任务生成无人工标注的高质量图文训练数据?help研究问题图表图像与视觉内容可访问性
改进后的多模态模型在UI元素识别、描述生成和任务规划中能达到什么性能水平?lightbulb现实痛点图表图像与视觉内容可访问性
用户难以有效理解复杂界面,阻碍自动化操作和无障碍技术发展。help研究问题图表图像与视觉内容可访问性
盲人在使用生成式AI(如自然语言描述和内容提取)辅助生成内容时,实际有哪些挑战和需求?help研究问题图表图像与视觉内容可访问性
生成式AI如何与屏幕阅读器结合,以增强盲人处理文档的效率?help研究问题图表图像与视觉内容可访问性
如何设计生成式AI的互操作功能,以便盲人能在不完全替代屏幕阅读器的情况下获得支持?lightbulb现实痛点图表图像与视觉内容可访问性
盲人难以高效使用文档工具处理图表或协同任务。help研究问题图表图像与视觉内容可访问性
当前的互动座位图如何未能全面支持残障人士的票务购买需求?help研究问题图表图像与视觉内容可访问性
残障人士如何适应现有系统的设计缺陷以完成票务购买?help研究问题图表图像与视觉内容可访问性
从用户分类为基础的座位设计方法转向基于座位属性分类的设计原则能否更好地满足残障人士的需求?lightbulb现实痛点图表图像与视觉内容可访问性
残障人士买票时无法获得充分的无障碍信息,独立参与公共活动有难度。help研究问题图表图像与视觉内容可访问性
如何结合多模态大语言模型与视频无障碍指南,提高AI生成的盲人或低视力用户视频描述的清晰度与准确性?help研究问题图表图像与视觉内容可访问性
构建一个包含高质量视频描述的大型数据集(如VideoA11y-40K)能否显著提升现有多模态语言模型的表现?help研究问题图表图像与视觉内容可访问性
AI生成的视频描述是否能够比初学者生成的描述更贴合音频描述专业标准?lightbulb现实痛点图表图像与视觉内容可访问性
盲人难以高效获取视频内容信息,现有的音频描述稀少且成本高昂。help研究问题图表图像与视觉内容可访问性
如何提升图像化表格在盲人和低视力用户中的可访问性?help研究问题图表图像与视觉内容可访问性
如何通过交互模型使盲人和低视力用户能够灵活获取表格信息?help研究问题图表图像与视觉内容可访问性
图像化表格的复杂结构和语义信息如何准确提取并转化为可理解的替代文本?lightbulb现实痛点图表图像与视觉内容可访问性
盲人和低视力用户难以理解图像化表格的信息。help研究问题图表图像与视觉内容可访问性
如何通过密集视频字幕技术生成高效的漫画图像描述来帮助视障人士?IUI '24"Generating Comic Image Descriptions Using Dense Video Captioning Techniques to Serve Visually Impaired Individuals"
help研究问题图表图像与视觉内容可访问性
相比传统单图像描述方法,分组处理能否有效减少漫画图像信息冗余?IUI '24"Generating Comic Image Descriptions Using Dense Video Captioning Techniques to Serve Visually Impaired Individuals"
help研究问题图表图像与视觉内容可访问性
视障用户对分组漫画描述的内容偏好如何,包括细节和背景信息的需求?IUI '24"Generating Comic Image Descriptions Using Dense Video Captioning Techniques to Serve Visually Impaired Individuals"
lightbulb现实痛点图表图像与视觉内容可访问性
视障用户难以理解漫画剧情,传统单图像描述又冗余且低效。IUI '24"Generating Comic Image Descriptions Using Dense Video Captioning Techniques to Serve Visually Impaired Individuals"
help研究问题图表图像与视觉内容可访问性
如何将图表从位图格式转换为适合盲人和视障用户的辅助使用格式?help研究问题图表图像与视觉内容可访问性
人工智能技术(如OCR和实例分割算法)如何支持图表的高效元数据提取和可访问性转换?help研究问题图表图像与视觉内容可访问性
如何通过用户友好的界面提高图表可访问性转换的效率和准确性?lightbulb现实痛点图表图像与视觉内容可访问性
盲人很难获取缺乏元数据的位图格式图表中的信息help研究问题图表图像与视觉内容可访问性
AI如何协助作者为跨领域的科学图表编写高质量的alt text(辅助文本)?help研究问题图表图像与视觉内容可访问性
交互式生成方法能否有效帮助作者迭代改进科学图表的alt text?help研究问题图表图像与视觉内容可访问性
结合元数据提取和用户实时反馈的方法对科学图表alt text生成有何影响?lightbulb现实痛点图表图像与视觉内容可访问性
盲人或低视力读者难以理解科学论文中的复杂图表。help研究问题图表图像与视觉内容可访问性
现有的图像探索系统如何满足中国视障用户的多层次信息需求?UbiComp '24AI-Vision: A Three-Layer Accessible Image Exploration System for People with Visual Impairments in China
help研究问题图表图像与视觉内容可访问性
AI-Vision系统是否可以通过多模态交互改进视障用户的图像探索体验?UbiComp '24AI-Vision: A Three-Layer Accessible Image Exploration System for People with Visual Impairments in China
help研究问题图表图像与视觉内容可访问性
利用多层次信息设计能否提升图像系统的易用性和适配性?UbiComp '24AI-Vision: A Three-Layer Accessible Image Exploration System for People with Visual Impairments in China
lightbulb现实痛点图表图像与视觉内容可访问性
视障用户难以高效获取图像的完整语义和细节信息。UbiComp '24AI-Vision: A Three-Layer Accessible Image Exploration System for People with Visual Impairments in China
help研究问题图表图像与视觉内容可访问性
空间音频(如通过音调和立体声通道调整)如何增强盲人和弱视用户在触屏上探索和理解复杂图形的能力?help研究问题图表图像与视觉内容可访问性
多模态反馈(包括振动、声音和文本描述)如何帮助盲人用户高效识别数据趋势?help研究问题图表图像与视觉内容可访问性
与传统声音反馈相比,空间音频在复杂图形(如柱状图和散点图)的数据趋势感知上有哪些优劣?lightbulb现实痛点图表图像与视觉内容可访问性
盲人难以在触屏上直观探索和理解复杂图形的数据趋势。help研究问题图表图像与视觉内容可访问性
儿童的视觉能力差异会影响他们如何理解由可变形设备传递的情感表达吗?help研究问题图表图像与视觉内容可访问性
儿童如何将触觉刺激与情感联系起来?help研究问题图表图像与视觉内容可访问性
不同形状和动态(如触须、尖刺)如何影响儿童感知的情感强度与类别?lightbulb现实痛点图表图像与视觉内容可访问性
视障儿童难通过图像或视频感知情感,影响科技互动体验。help研究问题图表图像与视觉内容可访问性
如何为盲人用户设计更高质量的AI生成图像的替代文本?help研究问题图表图像与视觉内容可访问性
AI生成图像的独特特性(如风格组合和生成偏差)对替代文本描述有哪些需求?help研究问题图表图像与视觉内容可访问性
不同来源的替代文本(生成提示、创作者撰写、专家撰写、自动生成)在质量上有何差异?lightbulb现实痛点图表图像与视觉内容可访问性
盲人用户很难理解AI生成图像内容,现有替代文本不足或不清晰。help研究问题图表图像与视觉内容可访问性
如何通过增强音频描述提升盲人或低视力用户对视频内容的理解和沉浸感?help研究问题图表图像与视觉内容可访问性
增强音频描述中的分层式交互机制是否比传统静态音频描述更有效?相关论文
IUI 2025
ILuvUI:通过机器对话进行UI的指令微调语言-视觉建模
Yue Jiang, Eldon Schoop, Amanda Swearngin
CHI 2025
天空才是极限:理解生成式AI如何提升屏幕阅读器用户在生产力应用中的体验
Minoli Perera, Swamy Ananthanarayan, Cagatay Goncu
CHI 2025
这个座位对我而言方便使用吗?:一个行动障碍人士使用公共活动互动座位计划的自我民族志研究
Lukas Strobel, Kathrin Gerling, Jan Ole Rixen
CHI 2025
VideoA11y:可访问视频描述的方法和数据集
Chaoyu Li, Sid Padmanabhuni, Maryam S Cheema
CHI 2025
表格叙述者:使图像表格对盲人和低视力人群可用
Ye Mo, Gang Huang, liangcheng li
IUI 2024
Chart4Blind:图表无障碍转换智能接口
Omar Moured, Morris Baumgarten-Egemole, Karin Müller
IUI 2024
FigurA11y:用于撰写科学替代文本的AI辅助工具
Nikhil Singh, Lucy Lu Wang, Jonathan Bragg
CHI 2024
空间音频增强的多模态图形渲染,用于触摸屏设备上的高效数据趋势学习
Wilfredo Joshua Robinson Moore, Medhani Kalal, Jennifer L. Tennison
CHI 2024
通过形状变化向视力障碍儿童和非视力障碍儿童传达情感
Isabel Neto, Yuhan Hu, Filipa Correia
CHI 2024
从来源到异常:图像创建者和屏幕阅读用户对AI生成图像的替代文本的观点
Maitraye Das, Alexander J. Fiannaca, Meredith Ringel Morris
CHI 2024
SPICA:通过增强音频描述为盲人或低视力观众互动探索视频内容
Zheng Ning, Brianna L Wimer, Kaiwen Jiang
CHI 2024
使用分层视频摘要使短视频可访问
Tess Van Daele, Akhil Iyer, Yuning Zhang