原始注视数据与派生指标的留存策略不同
别名: 原始眼动 · 热图留存 · gaze derivative
概念解释
眼动产物至少分两层。原始注视数据是按采样率留下的坐标、时间戳、瞳孔直径、有时还有眼图;派生指标是从中算出的热图、兴趣区总停留、一次会话的平均负荷分。两层的再识别能力和事后新推断空间不同,留存期、访问权和是否允许上传不能共用一条政策。把热图的宽松规则套到原始流上,等于把最敏感的一层用最不敏感的理由留下。
机制
原始流保留了扫描路径的全部时间结构,可以在采集目的之外训练新模型:明天的算法能从昨天的文件里读出今天还没定义的属性。派生指标把结构压扁——热图丢掉顺序,AOI 时长丢掉路径——再识别变难,但仍可能泄露“对哪一类对象停留更久”。压得越扁,事后推断越窄,功能也越受限制。
因此留存策略要按“还能再变出什么”来分级,而不是按文件大小。本地、短 TTL 的原始缓冲可以支持当次的注视渲染或当次校准;跨会话上传的原始文件几乎总是超过功能所需。聚合到人群的派生统计,再识别风险低于单人热图;单人热图又低于单人原始流。
怎么研究
在同一批轨迹上比较:原始重放、单人热图、AOI 矢量化、人群聚合,各自能支持哪些推断(身份、观看内容、负荷)。再测删除原始之后,产品功能(注视光标、渲染岛、简单的注意力热图)有哪些必须停。 这是功能–风险对照,不是单纯的匿名化竞赛。时间维度也要测:原始文件留 30 天与留 30 秒,对事故回溯和滥用窗口完全不同。法律文本里的“匿名化”往往仍保留可再识别的派生,不能当作技术结论。
边界
安全事故调查、医疗研究或经明确同意的科学数据采集,可能有正当理由把原始流留得更久,但那是另一条同意,不能和产品遥测混用。实时注视渲染只需要毫秒级缓冲,谈不上“留存”。边缘设备算力不足、必须把原始流送到云端才能出派生时,传输本身就是留存事件,要按原始层而不是按“我们最终只存热图”来管。残障辅助日志若需要回放一次会话来调试误选,应做成用户可导出、可删除的本地包,而不是默认云端档案。
怎么落地
- 分层:原始流默认设备内、按分钟或按会话销毁;派生指标按功能所需设上限;人群聚合才考虑长期。
- 上传清单里禁止出现坐标时间序列和瞳孔直径,除非有单独的、可关闭的研究同意。
- 验证:切断原始存储后走一遍核心功能,列出仍能工作的和必须停的;对仍上传的字段做一次再识别和内容推断的桌面推演。