每条只念一两项区分性信息
别名: 区分性字段 · 列表不要念全档案 · contrastive readout
概念解释
三班去北京的航班,每班念「航班号、起降时刻、机型、餐食、有没有 Wi-Fi、值机口」。听完三条,对比用的那一维——直飞还是经停、早上还是中午——已经被六七个相同字段淹没。每条只念一两项区分性信息(distinctive-field spoken items)要求:当前集合里,条目与条目之间真正不一样的那一两个字段才值得占用耳朵。其余档案不是不存在,是不该出现在这一轮的口头对比里。
机制
听觉对比靠的是还留在缓冲区里的差异,不是记录的完整。一条里字段越多,各条共享的部分(都是去北京、都是客机)重复占用时间,把真正分叉的那一维挤到中段或尾段,对比失败。区分性是相对于当前集合的:三家都叫星巴克时,品牌不是区分项,距离或路名才是;三家品类不同时,品类先于评分。把「信息量大」当成「每条多念一点」,是在用完整度破坏可判别性。
一两项也要选对。念了两条都不变的字段(三班都有餐食),等于没念。念了用户此刻决策用不上的字段(机型),占用了本该给时刻或经停的位置。区分性随筛选变化:用户说「只要直飞」之后,直飞不再区分,出发时刻顶上来。
怎么研究
同一候选集,两种播报:全字段对当前对比集上互信息最高的一或两个字段。听完做迫选或排序(「哪班更合适」),再追问依据。因变量:选择与客观最优的一致、说出的依据是否等于区分字段、以及打断是否落在重复字段上。自变量:集合内字段的变异(有的字段全相同、有的字段全不同)、每条字段数。
不要用「信息是否充分」的主观分。充分感可以来自念得长。把字段印成表再听,测到的是视觉对比,不是听觉区分。现场看用户在第几条、第几个字段开口选定——开口若总在区分字段之前,后面的字段已经是噪声。
边界
集合里只有一条时,没有对比对象,区分性无意义,该念的是这一条的决策字段(几点到、哪一站下),不是「相对其他候选的差异」。法律或安全必须当场说清的项(红眼航班、过敏源)即使在集合内不变,也不能裁掉。专家用户对固定槽位(调度员听机号)有模板,他们的「区分」是模板上的那一格,不是算法算出的互信息。屏幕同时列出全档案时,口头仍应只念区分项——那是通道分工,不是把屏幕上的表再读一遍。
怎么落地
- 播报前对当前页的候选算一遍:哪些字段在条目间真的变。只把变的、且对当前决策有用的一到两个放进每条的口头模板。
- 筛选条件一变就重算区分字段,不要沿用上一轮的模板(「只要直飞」之后别再把直飞念三遍)。
- 被裁掉的字段留到点名之后再给,或留给屏幕;不要为了「完整」在对比轮塞回去。
- 验证:同一三班航班,全字段版与「时刻 + 直飞/经停」版。听完问「你凭什么选」。依据说不出区分维、或选成了最后听到的那班,字段就还没裁对。