长回答需要结构化而非线性铺陈
别名: 口头回答要有层次 · 先总后分 · hierarchical spoken summary
概念解释
问「明天有什么安排」,系统从早上八点的站会一路念到晚上九点的聚餐,十二个事件排成一条没有停顿等级的句子。听的人拿到的是音流,不是一份事后还能按块取回的报告。结构化口头回答(structured spoken answers)把长输出先收成可抓住的骨架——「上午两场会,下午空,晚上聚餐」——细节按需展开。线性铺陈不是「信息全」,是把层次抹平,让工作记忆无法给这段话建目录。
机制
听长段时,人不是把每个词都存下来,而是边听边抽主题、建组块。若韵律和句法不标记边界,抽取失败,整段退化为必须从头复述才能定位某一项的磁带。骨架先到,后续细节可以挂到已经立住的节点上(「下午那块是空的」成为可寻址的抽屉);细节先到、骨架永远不到,后到的词只能往一个没有隔间的缓冲区里堆。这和选项数量上限不是同一件事:一条回答可以很长,只要层次浅、节点少;也可以很短,但十二个等重事件连着念,仍然不可检索。
线性铺陈还会逼出错误的听法:为了不错过后面,人放弃整合前面,最后只记得结尾那句。结构的作用是允许「听懂形状、再决定要不要听叶子」,而不是把叶子当句子主语排成队。
怎么研究
把同一份日程做成两种播报:层级摘要(先块后项)与等权线性朗读(按时间挨个念)。听完后做两类提取:要旨(上午忙不忙、晚上有没有社交)和探针细节(「十四点那项是什么」)。自变量包括事件数、块的个数、是否允许在摘要之后口头展开某一块。因变量看要旨正确而细节失败、或细节正确而说不出块——两种失败指向不同的编码损坏。
不要用「觉得好记」当主指标。回忆产出的结构树(被试画出或说出几块、每块几项)比评分更能显示有没有建成目录。实验室若把材料印成大纲再让人听,测到的是阅读结构,不是听觉结构。
边界
回答本身就是一个原子事实(「门开了」「闹钟已设」),没有可折叠的层次,结构是空的。用户已经拿着屏幕看同一份日历,语音只报变化点,结构负担在视觉那边。紧急告警要的是最短路径上的那一个命题,先骨架再展开会耽误叶子上的关键数(剂量、出口)。专业用户对固定日报有自己的槽位模板,线性顺序若恰好等于他们的模板,听起来像结构;换一个没有模板的听众,同一顺序仍是铺陈。
怎么落地
- 超过两三句的回答先给可点数的骨架(几块、每块的标签),默认停在骨架;用户点名一块再展开,而不是自动把叶子念完。
- 骨架里的节点要能被口头指称(「下午那块」「晚上那项」),否则结构只对系统存在,对听的人仍是一条带子。
- 不要用连接词把十二个事件串成「然后…然后…然后」来冒充结构;没有可回指的节点,就还是线性。
- 验证:播完只问两句——「明天大概分成几段」「下午有没有事」。答得出块答不出叶子,结构成立;两问都靠最后听到的那句来蒙,就是铺陈。