方案间需有可辨差异
别名: 可辨差异 · 近重复候选 · discriminable alternatives
概念解释
三个「专业而友好」的回复,差在逗号和「您好」对「你好」。人无法说出它们在决策维度上有何不同,却仍被要求选一个。没有可辨差异的集合不是多方案,是同一方案的表面变体。方案可辨性(option distinctness)要求候选在用户真正用来做决定的属性上分开,而不是在用词上抖动。
比较退化为挑标点,是可辨性已经失败之后的事。这里问的是集合算不算选项。
机制
选择依赖属性对照。人先找「这几个哪里不一样」,再按那个维度取舍。采样若来自很尖的分布,抽到的路径在语义上挤在一起,表面 token 不同、决策属性相同。温度升高会增加用词抖动,不一定增加用户在乎的那一维(语气、结构、承诺强度、构图重心)的距离。
不可辨的集合有两种坏处。一是假选择:人必须完成一次没有信息量的点击。二是训练错误预期:下次仍以为「再生成几个」会展开空间,其实只是在同一点附近抖。
怎么研究
对同一提示生成 n 个方案,分别测嵌入距离、人工「它们是不同方案吗」评分、以及用户能否用一句话说出差别。自变量:解码温度、显式多样性约束、是否按指定维度(正式/非正式、短/长)强制分开。因变量:可命名差异率、选择时间、选择后能否复述选中项与落选项的差别。
可命名差异是关键指标。嵌入距离大但用户说「差不多」,说明分开的不是决策维度。只报自动多样性分数会把用词抖动算成成功。
边界
用户要的就是微调(「再稍微短一点」),近距离变体是功能,不是缺陷。封闭答案并列近重复是危险的,因为人会把无意义差别读成隐含义。图像生成里「同一构图换配色」可以是可辨的,因为配色就是决策维;文案里换配色没有对应物。屏幕阅读器用户听三个近义段落,可辨性比视觉浏览更差,需要在方案标题里先写出维度差。
怎么落地
- 生成多个方案时,按用户任务的决策维强制分开:长度、语气、结构、承诺程度,而不是只提高温度。
- 每个方案用一短句标出它和其他方案的差别。人说不出差别时,不要把它们当成多个方案交出。
- 检测近重复:语义高度重叠的项合并或重抽,不要并列摆出。
- 验证:生成结束后问「这几个有什么不同」。答不出具体决策维(只能说「用词不太一样」)的集合,不算多方案。