AXNav: 从自然语言重播可访问性测试
作者
语音可访问性大语言模型(LLM)的人机协作UI/UX 设计师HCI 研究员
文献标题
AXNav: Replaying Accessibility Tests from Natural Language
文献信息
- 主题领域: 基于自然语言的辅助功能测试自动化
- 关键词: 辅助功能测试, UI自动化, 大型语言模型, 自然语言处理, 测试工具, 人机交互, 测试自动化, 多模态规划, 屏幕阅读器, 动态字体
研究背景与问题
-
作者发现了哪些问题或挑战?
- 大多数应用程序在使用辅助功能特性(如屏幕阅读器、动态字体等)时支持不完善,主要因为缺乏相关经验、意识或组织支持。
- 尽管已有许多测试和检查工具,但行业仍主要依赖耗时且难以扩展的手动测试。
- 自动化测试工具(如GUI测试和可访问性检查器)存在脆弱性,不能有效适应UI变更,且扫描结果可能含有大量误报。
- 手动测试完整覆盖所有场景和特性的难度较大,尤其是在需要频繁更新的开发环境中。
-
为什么这个问题很重要?
- 无障碍性对于确保应用程序对残障人士的适用性和公平性至关重要。
- 自动化测试不足不仅增加人工成本,还可能导致问题未被及时发现,最终损害用户体验。
- 高效的辅助功能测试工具能显著改善开发质量,并帮助实现更广泛的用户覆盖。
-
研究动机与相关工作
- 尽管已有研究尝试使用大型语言模型(LLMs)进行自动化任务(如UI交互和调试报告再现),但尚未有研究专注于如何利用LLMs执行针对辅助功能的测试任务。
- 当前手动测试工具往往依赖静态的步骤记录,易于在UI更新中失效。研究希望通过自然语言与模型驱动的动态响应来改善这一现状。
- 从业者表示大规模手动测试的重复性和更新成本过高,因此需要设计一种方式以减少手工步骤,同时保留人性化检查的灵活性。
解决方案
-
作者提出了哪些方法或解决方案?
- 构建了名为AXNav的新系统,从自然语言描述中理解手动测试指令并在实际应用程序中重现测试。
- AXNav能够启用并配置多种辅助功能(如VoiceOver、动态字体、粗体字体等),通过模型推导生成可操作的步骤计划并执行。
- 测试完成后,生成标记了章节和注解的视频,帮助测试人员快速定位可能的无障碍问题。
-
该解决方案的创新之处是什么?
- 使用LLM驱动的多代理架构:AXNav通过多代理架构(Planner、Action和Evaluator)动态生成和修订计划,能够在面对意外场景(如UI变化、权限请求)时动态调整测试步骤。
- 像素级UI识别与自然语言接口结合:采用像素级的UI检测模型,为LLM提供屏幕结构和交互建议,能够适应未知应用程序。
- 多层级无障碍性能分析:开发了一组自定义的启发式算法,针对特定的无障碍问题(如循环导航、字体缩放不一致等)进行检测并标记。
-
实施步骤是什么?使用了哪些关键技术?
- 设备分配与控制: 使用远程云端iOS设备,安装目标应用,并配置辅助功能。
- 测试计划与执行:
- 计划生成: 基于自然语言指令生成可操作步骤的JSON结构。
- UI元素交互: 使用带边界框的像素级UI识别与VoiceOver手势指令结合操作。
- 动态再计划: 如果错误发生或计划不可行,则触发调整。
- 启发式检测: 检测以下问题:
- Dynamic Type字体缩放不一致。
- Button Shapes中的点击元素标识问题。
- VoiceOver的导航循环或缺失元素。
- 输出结果: 自动生成标记关键问题章节的交互视频,提高回顾效率。
研究成果
-
取得了哪些具体成果?
- 在真实测试集和自构开放数据集上的重放准确率分别达到了85.5%(复杂任务准确率61.1%)和70%(复杂任务准确率64.3%)。
- 系统被10名专业测试员评估为“非常有用”,尤其是在标准化和高效执行多测试步骤方面。
- 系统自动生成的可交互视频帮助测试人员快速定位潜在问题,且可以作为调试报告辅助材料。
-
与现有解决方案相比,它有哪些优势?
- 更高的灵活性和动态调整能力:不依赖硬编码的交互路径,可适应UI频繁变更。
- 语义化的自然语言接口:用户可以通过简洁的描述启动复杂任务,而无需深入学习自动化框架。
- 较高的覆盖率:集成了4种不同的辅助功能支持(VoiceOver,Dynamic Type等),并能基于启发式规则分析具体问题。
-
实验或评估结果是什么?
- 技术评价: AXNav在复杂任务的导航中表现尚可,但仍有改进空间,例如更有效地处理集合项选择。
- 用户评价: 视频章节、大型语言模型指导的逻辑输出被认为对人工测试工序具有显著补充作用。
- 用户偏好: 参与者认为在未来集成中,该工具可通过并行测试显著减少手动工时。
-
局限性与未来方向:
- 局限性:
- 当前只支持iOS平台;未来需拓展到Android等其他操作系统。
- 在特定场景下UI导航计划可能失败,例如某些需要滚动或多层嵌套的任务。
- 视频内容对屏幕阅读器用户不友好。
- 未来方向:
- 提高LLM导航能力,例如集成特定的上下文背景建模。
- 支持其他无障碍功能(如颜色反相、语音控制)和更广泛的启发式检查。
- 提供适合非视觉用户的交互显示,并增强透明度(如错误原因解释)。
- 引入更高效的用户界面总结机制,例如仪表板形式总结问题。
- 局限性:
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何使用大语言模型(LLM)将自然语言描述转化为可执行的辅助测试计划?分类: ML/AI 模型可视化与可解释分析同类问题arrow_forward
- AXNav系统如何在UI频繁变化的情况下动态调整测试计划以提高灵活性?分类: ML/AI 模型可视化与可解释分析同类问题arrow_forward
- 可视化输出(如带注释的交互式视频)能否有效提升辅助测试的效率和准确性?分类: ML/AI 模型可视化与可解释分析同类问题arrow_forward
lightbulb
现实痛点
1- 开发者难以高效地测试和优化应用的辅助功能支持。分类: ML/AI 模型可视化与可解释分析同类问题arrow_forward
- 80%
Persona-L已加入聊天:利用基于能力框架的LLM为复杂需求人群创建人物模型
CHI '25· 语音可访问性 +2
- 67%
IdeaBot:探究人机团队创造力中的社会促进作用
CHI '21· 对话式聊天机器人 +3
- 60%
从HCI研究中映射机器学习进展以揭示设计创新的起点
CHI '18· 大语言模型(LLM)的人机协作
- 60%
输入效率和建议准确性影响单词建议的收益和采用
CHI '21· 大语言模型(LLM)的人机协作 +1
- 60%
乐观主义:启用领域特定元启发式优化的协作实现
CHI '23· 生成式AI(文本、图像、音乐、视频) +1
- 60%
使用大型语言模型为UI草图生成自动反馈
CHI '24· 大语言模型(LLM)的人机协作 +1
- 60%
Canvil:为LLM驱动的用户体验设计适应性
CHI '25· 360° 视频与全景内容 +1
- 60%
没有证据表明大语言模型在问题重构中是有用的
CHI '25· 大语言模型(LLM)的人机协作 +1
- 60%
PlanTogether:使用信息图和大型语言模型促进AI应用程序规划
CHI '25· 大语言模型(LLM)的人机协作 +1
- 60%
对话架构对对话智能体感知的影响
CUI '23· 会话代理的人格与拟人化 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642777
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
语音可访问性、大语言模型(LLM)的人机协作
work
职业/产业
UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文