评估需要长周期部署
别名: 长期 HRI · longitudinal HRI · diary study
概念解释
要判断一个社交机器人到底有没有被接受、有没有长期价值,需要做长周期部署研究(longitudinal field evaluation),把机器人放到真实使用环境里持续观察数周到数年;只测第一次接触或者短短几天数据的研究,会系统性高估用户对机器人的接受度。
机制
这是新奇效应会带来虚高数据这一事实在方法论上的必然结果。既然新奇效应会在部署初期制造出虚高的参与度和满意度,那么任何只测前几天数据的研究,测到的主要成分就是新奇效应本身,而不是产品长期价值——这在方法论上是一种混淆变量的问题,不是简单地"样本量不够大"就能解决,而是"测量窗口本身选错了时间段",样本量再大,窗口选在新奇期内,结论照样会系统性偏高。这里还有第二层混淆:横截面研究——同一时间点比较不同用户——没办法把"人和人本来就不一样"和"同一个人随时间发生了变化"这两件事分开,容易把两种完全不同的原因混在一起下结论;而且只要研究者还在场提醒、定期上门维护,用户的使用行为也可能是被这份额外关注维持住的,一旦研究结束、提醒和维护撤走,真实的自然使用水平可能会立刻回落到更低的位置。
怎么研究
这一条本身就是关于"怎么研究"的核心内容。长期部署研究通常把机器人放在家庭、学校、养老机构等真实环境里,持续数周到数年,通过使用日志、周期性问卷、定期访谈、日记法(diary study)追踪使用模式随时间的变化。相比实验室研究,这类研究面临几个现实困难:样本流失——用户中途退出研究导致后期数据量骤减;环境干扰变量难以控制——家庭作息、季节、家庭成员变化都会影响使用行为但很难被记录和排除;以及研究本身的成本和周期都远高于实验室研究——这是长期部署研究相对少见的现实原因,不是研究者不知道该怎么设计。一种常见的采样策略是早期做更密集的记录(比如按周),后期转为较稀疏的记录(比如按月),用来给适应过程本身建模,而不是武断地把开头几周的数据当作"被新奇效应污染"直接丢弃——丢弃掉的这部分数据恰恰包含了衰退速度本身的信息,是分析新奇效应大小的关键素材,不是噪音。
边界
长期部署研究的结果高度依赖具体场景:家庭场景和机构场景不一样,单用户独享和多用户共享同一台机器人也不一样,不能把某个场景测出的时间曲线直接套用到另一个场景。当预算或时间不允许做真正意义上的长期部署时,至少应该在报告结论的时候明确标注"本结果基于N天数据,可能受新奇效应影响,不代表长期采纳水平",而不是把短期数据包装成长期结论直接拿去做产品决策。此外,研究团队提供的设备通常免费、出故障能被及时上门修复,这类高强度支持本身也会限制外部效度,测出的留存率不能直接当作普通消费者购买产品之后的预期表现;短期受控实验在隔离单一因果机制这件事上仍然有不可替代的价值,不会被长期部署研究完全取代,两者回答的是不同的问题。
怎么落地
产品是否继续投资、是否规模化部署这类决策,应该优先参考长期部署数据,而不是首发试用或媒体演示阶段的数据。如果条件确实不允许做完整的长期部署,退而求其次的验证办法是做一次"移除新鲜感"的对照:让一部分用户先在没有研究人员在场、没有额外提醒的自然环境下使用两到三周,等新奇效应大概率已经衰退之后,再收集这批用户的评估数据,而不是在刚发布或刚交付的当天就立刻收集反馈当作长期结论使用。评估时还要把行为日志与体验访谈、实际收益评估、旁观者(家属、工作人员)反馈三方交叉验证,而不是只用一个互动次数指标代表"成功"——这三方数据经常会在弃置或降级使用的判断上出现分歧,分歧本身就是需要追查的信号,而不是可以忽略的噪音。