三层各自需要不同的评测方法
别名: 测量错配 · 测评方法映射 · 生理指标 · measurement mismatch
概念解释
三层判断在不同时间窗内、以不同编码方式形成,每层的信息只在特定窗口内可及,因此每层都有自己的一套测量传统:本能层靠瞬时反应测量,行为层靠任务表现测量,反思层靠记忆与叙事测量。仪器与层错开就会产生测量错配(measurement mismatch),而且错得毫无破绽——数字真实、统计显著,只是它量的是另一层。
机制
错配的根源是各层的编码方式决定它留下的可测痕迹不同。本能层的反应只存在于刺激呈现后的几百毫秒内,随后被后续加工覆盖,能采到它的只有瞬时指标:低于一秒的曝光判断、毫秒级生理信号、快速好恶任务;事后问卷采到的永远只是它的遗迹。行为层的效能感分布在任务全程的每一次操作里,瞬时指标反而采不全,能采到它的是表现数据与操作中的主观掌控感。反思层的结论只在事后与长期存在,当下问「你觉得怎么样」问不出它,能采到它的是延迟回忆、日记与长期态度。两种典型错配:用满意度问卷测本能层第一印象——问卷在事后填写,即时反应早已完成并被反思层的总结覆盖,量到的是总结而非第一印象;用瞬时生理反应预测长期依恋——皮电与瞳孔反映的是当下唤醒,与数周后的留存、推荐之间没有稳定通道,把短期唤醒当长期预测是押在时间尺度错配上的赌注。
怎么研究
各层对应的测量传统都有真实积累。本能层:50–500 毫秒曝光后的好恶评分与二选一偏好任务、情感启动(affective priming)、面部肌电(facial EMG,皱眉肌与颧骨肌活动区分效价)、瞳孔扩张与皮电记录唤醒、眼动首注视偏好;曝光范式成本低,生理指标需要实验室设备。行为层:完成率、错误率、任务时长等表现数据,配合任务后即刻填写的掌控感与效能感自评,以及操作中的过程性口头报告。反思层:数周后的延迟回忆(delayed recall)、经验取样(experience sampling)与使用日记、长期态度与推荐意愿的追踪测量、回顾性访谈。方法论注意点:测量的时间窗必须与层的时间尺度匹配,仪器与层错开一档,采到的就是相邻层的信号;三层指标之间的相关通常不高,任何一层都不能代表其他层;生理指标给出的是唤醒与效价方向,不构成对具体设计元素的归因,必须与曝光设计配合才能指向元素。
边界
层与仪器的对应不是一一锁死:有些仪器跨层可用,眼动既采首注视偏好也采任务中的搜索路径,区别在采样窗口与指标解释,不在仪器本身。反思层测量周期最长、成本最高,长时程追踪自带流失偏差——留下来的用户被系统过度采样,流失用户的反思层结论恰恰缺测,偏差方向与结论同向。实验室瞬时测量的生态效度有限:极短曝光下判断的一致性好,不等于真实首访环境中反应强度相同。问卷并非不能用——写明测哪一层、放在匹配的时间窗(任务后即刻对行为层、数周后对反思层),同一份量表在不同时点就是不同层的仪器;错的是拿一个时点的问卷冒充所有层的结论。
怎么落地
- 按决策的作用层选仪器:视觉与质感决策配曝光测试或快速偏好任务;流程与交互决策配表现数据加任务后即刻的效能感自评;意义与品牌决策配延迟访谈、日记与长期指标追踪。
- 给每个指标标注它采的是哪一层、在什么时间窗;报告时分列,不合并成单一总分。
- 指标异常时先问仪器采的是哪一层,再归因于设计——延迟访谈的负面结论不该拿去改首屏视觉,首印象的冷淡也不该由流程改动来背。
- 验证办法:同一决策配两台不同层的仪器(首印象曝光测试加数周后延迟访谈),检查两层结论是否各归各位、没有被互相替代;发现用一层的数据论证另一层改动的文档,就是错配已经发生的现场证据。