两个通道的时序需要对齐
别名: 声画对不上 · 高亮跟不上播报 · cross-modal lag
概念解释
TTS 还在念第一家餐厅,屏幕已经高亮第三张卡片。用户说「就要这家」,「这」绑到眼睛上的第三家、耳朵里的第一家,系统无法知道该收哪一个。导航地图已经切到下一弯,语音还在收上一弯的尾音,同一种错位。语音与屏幕的时序对齐(temporal alignment of voice and screen)要求两个通道在指同一个对象的那几秒里同时在场,而不是各走各的刷新时钟。
机制
跨通道绑定依赖时间上的重合:同一对象的听觉标签和视觉标记要落在一个可被当成「这一拍」的窗口里。窗口可以有一点固定延迟(高亮略早于词,像字幕),但不能漂移。TTS 时长随语速、插播和网络抖动变,界面动画按自己的曲线走,两条时间线一旦解耦,指示词、序号和焦点行就指向不同实体。人会用当时显著性最高的通道去理解「这个」——通常是眼睛正在看的那一张——系统若按语音进度计,就绑错。
错位还有方向:屏领先,人以为语音在报当前高亮,其实在报已经划走的项;语音领先,人在屏上找一个还没画出来的对象,以为系统在说屏外的东西。对齐不是「不要把同一句话写两遍」,是让两遍(即使内容分工不同)在时间上指同一个指示对象。
怎么研究
把高亮相对 TTS 目标词的起点做成时移:同步、超前 300 / 800 毫秒、滞后 300 / 800 毫秒。诱发「这个 / 这家」。金标准用注视或事后点选「你指的是哪一张」。因变量:跨项错绑率、犹豫、以及用户是否改用序号来逃开错位。自变量包括语速(同一动画曲线配更快的 TTS 会放大超前)。
现场抓「屏幕焦点变化」与「TTS 词边界」的时间戳。焦点切换落在词中段或落在上一词上,就是系统性不对齐。实验室用按钮选而不说「这个」,测不到指示错绑。
边界
纯听无屏,没有第二条时间线要对齐。用户根本没在看时,对齐视觉焦点没有对象——该对齐的是下一次目光落回时的状态,而不是硬把高亮跟语音走给一个不在看的人。装饰性动画(背景呼吸灯)不参与指称,不必跟词对齐。极短的耳标配瞬时高亮,窗口短到对不齐也没关系,因为没有可被打断的指示短语。把时序问题理解成「动画可以再花哨一点」会加长视觉时间线,错位更大。
怎么落地
- 以正在播出的词为时钟:高亮、地图切页、卡片焦点只在对应词的窗口内切换,不要按列表动画自己的节拍抢跑。
- 语速或插播一旦改变 TTS 时长,视觉时间线跟着重排,不要播一条预渲染的动画。
- 「这个 / 这家」在错位窗口内不要静默消解;问「是屏幕上亮着的这家,还是刚念到的那家」,或先把两通道拉回同步再收。
- 验证:把高亮相对词边界做成同步与 ±800 毫秒两档,诱使说「这个」。错绑若随错位上升,时钟没对齐。再查现网焦点切换是否落在词中——落在词中就先修时钟,再修识别。