自动化工具与专家评估无法替代真实辅助技术用户的测试
别名: 障碍用户测试 · 辅助技术用户 · 专家评估不足
概念解释
自动扫描能抓到缺对比、缺 alt、缺标签;专家能用阅读器走完结账并写出问题清单。两样都做完,仍然不知道一个每天用 JAWS 的人会不会在第三步放弃。辅助技术用户测试(AT user testing)要的是:真实使用辅助技术完成自己目标的人,在真实任务里暴露的卡住、绕路和策略。自动化与专家评估是过滤网,不是代理用户。
专家自己开 NVDA,测的是「我按检查表能走通」;用户测的是「我的语速、我的快捷键、我的耐心,这单还下得下去吗」。两问不是同一问。
机制
自动规则只能判定机器可判定的属性存在与否。语义对不对、流程是否可完成、播报是否吵到无法思考,规则没有真值。专家评估补上了人的判断,但专家的熟练度、听力习惯、愿意试探的次数,和目标用户不是一个分布。专家知道「焦点丢了该去找」,用户可能以为应用死了。专家会为了写报告把每条路走完;用户有自己的时间预算,绕两次就走。
第二层是辅助技术本身的配置空间。阅读器的标点、提示级别、盲文表、网页浏览模式,专家实验室里几乎总是默认档。默认档上「能用」推不出用户档上能用。没有真实用户,这部分配置空间根本没被采样。
怎么研究
同一产品跑三层:自动扫描、专家走查(键盘 + 至少一种阅读器)、付费招募的辅助技术用户完成关键任务。对照三层各自发现的问题集合——重叠多少、哪一层独有。任务要用用户自己的目标(买票、续费、交作业),不要只用「找出所有标题」。记录放弃点,而不只是严重度评分。
自变量:评估层(自动 / 专家 / 用户)、任务是否用户自带。 因变量:独有问题数、任务完成、放弃步骤、专家未预见到的策略。
边界
极早期的纸面原型没有可运行的辅助技术,用户测试会退化成访谈,不能拿来宣称「已经和 AT 用户测过」。找不到目标障碍类型的用户时,专家走查仍是必做的过滤,只是结论必须写成「尚未被真实 AT 用户打过」,不能写成通过。有的问题(闪光频率、对比数值)用户未必能口头报告,自动测量仍不可少。把同事里「会开 VoiceOver」的人当成用户,测到的是同事的礼貌和内部知识,不是外部用户。
怎么落地
- 关键流程在自动和专家都过了之后,仍安排真实 AT 用户完成端到端任务,以放弃点为通过线,不以问题清单长度为通过线。
- 专家走查的报告里单独列「未用真实用户验证的假设」,避免把走查当验收。
- 不要用内部会开阅读器的工程师顶替招募。
- 验证:拿出最近一次「无障碍已测完」的记录,看有没有外部 AT 用户的任务录像或笔记。只有扫描分数和专家清单,就还没做这一层。把用户放弃的那一步标进缺陷,而不是标成「可用性建议」。