B5.09.1Effectiveness Measures设计研究
有效性以任务完成的准确与完整程度衡量,不等同于完成率
别名: 有效性测量 · 准确与完整 · 完成质量
概念解释
标准语境下的有效性由两个成分构成:准确性(做对了没有——错误数、错误严重度)与完整性(做到位了没有——目标状态的覆盖程度)。完成率只是两者的粗代理:一个「完成」可以是带着三处错误、跳过两个必需步骤的完成,把它记成 1 会同时高估准确与完整。
机制
完成率的二值化丢掉了质量信息,而任务的真实要求常常是分级的:报销单提交了但金额错误、报告导出了但缺一节,都是「完成」。准确与完整是两个独立维度——可以完整而不准确(全部做完但有两处错),也可以准确而不完整(做的部分全对但没做完)。两者的失败原因不同:准确性失败多源于反馈缺失与确认不足,完整性失败多源于流程断裂与入口缺失。
怎么研究
测量设计按标准要求先定义「准确」与「完整」的判据:准确性用错误计数与错误分类编码,完整性用目标状态核对清单逐项勾验。报告时分别给出准确完成率(无错误且完整)与部分完成分布,而不是单一完成率。观测方式上,自动日志能覆盖完整性与时间,错误分类仍需人工编码;两者结合才满足可追溯要求。
边界
判据的定义带主观性:「准确」的容差随任务而变,财务任务与内容创作的容错不同;完整性的核对清单由研究者构造,清单偏差直接影响结果。对探索性任务,「目标状态」本身模糊,准确与完整的操作性弱化。该测量框架假定任务有确定终点,不适用于开放性使用。
怎么落地
- 为每条任务写准完整判据:错误类型与容差、目标状态核对项,写入测试脚本。
- 测试报告分开呈现:无错误完整完成率、有错误完成分布、未完成断点分布。
- 把「带错完成」单独列为问题类别,它往往比未完成更能暴露反馈缺陷。