Z2.02.1Probabilistic activity recognition设计研究
活动识别是概率判断
别名: 活动识别 · 隐式活动识别 · activity recognition
概念解释
从传感器信号推断「用户在做什么」——活动识别(activity recognition)——输出的是概率分布,不是事实。系统内部的判断形态是「做饭 0.8、洗碗 0.15、其他 0.05」,而产品界面几乎总是把它呈现成一个确定的标签:「用户在做饭」。这层呈现丢掉了不确定性,让用户和上层自动化把概率判断当作确定事实来消费。
这个丢失不是显示问题,是责任问题:推断错误时的后果(误触发自动化、错误的个性化)由「当作事实用」的设计承担,而不由识别引擎承担。
机制
为什么只能是概率:传感器给的是间接证据——加速度模式、电流特征、声音频谱。同一活动有无数种做法(快炒与慢炖的信号差异可能大于做饭与洗衣的差异),不同活动又共享信号特征(见同组关于相似动作的讨论)。从信号到活动的映射本质上一对多,任何输出都只能是分布。
概率还在部署后漂移:模型在与训练集相似的数据上校准,而每个家庭的个体差异——身高、惯用手、器具、房间布局——使实际置信整体偏移;时间上下文进一步改变判断(同样的厨房声音,晚饭点报「做饭」、凌晨报「宵夜」),先验随场景移动,同一信号在不同时刻解不同。
怎么研究
- 基准研究:Bao 与 Intille 2004 年用五个身体佩戴的加速度计识别二十类日常活动,受控数据上总体准确率约八成,为这个领域的可靠性量级提供了参照——最好的条件下也有一到两成的错误率。
- 常见设计:自变量为传感器数量与位置、活动类别的粒度(粗类别显著更准)、训练数据的来源(被试本人 vs 他人);因变量为准确率与混淆矩阵。跨被试泛化是关键变量:模型用在别人数据上训练时,性能通常显著下降——这直接对应智能家居「无法逐人训练」的现实。
- 在野部署:让家庭长期佩戴或在环境中部署,比较受控数据与真实家庭数据的性能落差。
方法论注意点:论文准确率来自与训练集同分布的评测集,产品环境几乎必然偏离这个分布;引用文献数字做产品决策时,要默认实际错误率高于论文报告值。
边界
- 粒度决定可靠性。 「动/静」「在家/外出」这类粗判断可做到很可靠;「做饭 vs 洗碗」这类细判断可靠性断崖式下降。产品方案依赖的粒度越细,赌注越大。
- 置信会漂移。 搬家、换器具、换作息、家庭成员变化都使已校准的置信失效;识别质量不是一次性验收,是持续变量。
- 置信分数未必校准。 界面显示的 80% 不保证十次里对八次——未校准的置信分数比没有分数更有害,因为它给了错误的确信感。
怎么落地
- 下游动作按置信分档:高置信自动执行,中置信执行可逆动作,低置信升级为询问或保守默认。
- 界面表述避免把推断写成事实:「看起来您离开了」而不是「您离开了」;留出被否定的空间。
- 给纠正入口:让误判能被用户看见并纠正——纠正记录同时是评估识别质量的免费数据。
- 验证办法:抽样比对推断日志与真实活动(住户日记或摄像回看),得到每类活动的实际准确率与最常混淆的对;用实测数字而非引擎自报分数做设计决策。