J4.06.2terminology density设计研究
术语密度比句长影响更大
别名: 术语密度 · 未解释术语 · jargon density
概念解释
未解释的术语出现得有多密,通常比句子有多长更能预测外行读不读得懂。八个词全是行话的短句,难过三十个词、词都在读者词表里的叙述。可读性公式奖励切句,不奖励把空洞命题填上。
机制
每个未知术语要做一次心理词典检索,失败就在命题里留一个洞。句法工作记忆对母语读者往往还能撑过从句;空洞命题无法修补——读者不知道那个洞里本来该填什么。所以「每百词有几个未定义术语」相对读者词表来算,比平均句长更接近失败原因。
领域内熟悉的术语不是负荷,是压缩。密度必须相对于词表,绝对计数会把专家页判成灾难。公式看不见这一点:它只看见音节。把长句切断、术语原样留下,年级分数变好,外行的洞一个没补。反过来,句仍长,但每个术语第一次出现时有着落,理解可以过关。这里比的是两个预测变量谁主效应更大,不是在教怎么写句子。
怎么研究
析因:控制句长、操纵未定义术语个数;再控制术语、拉长句子。期望术语主效应更大,句长主效应更小或只在极端嵌套时出现。
自变量:未解释术语数 / 每百词、平均句长、读者是否为该领域内。 因变量:理解题、cloze、自报卡在哪一个词。
标注时把「未解释」写清楚:页内无定义、无链到定义、不能从上下文唯一推出。已在上文定义过的不算。
边界
读者就是该领域专家时,高密度是效率,降密度等于把他们已经组块好的单位拆开。诗、品牌名、必要的法定名称不是「术语问题」。多层否定、多重嵌套可以把理解单独打崩,那时结构也是主效应,不是永远只有术语。机器生成的通顺短句若术语全错,密度看起来不高,失败来自错误而不是密度——那是另一类校对。
怎么落地
- 面向公众的页,统计未解释术语,不要只看平均句长或年级分数。
- 关键术语在首次出现时能被这页上的信息着落(定义、例子、链到解释);不要用切断句子代替着落。
- 验证:把句界改到公式及格,但不给术语着落,领域外的人复述仍失败——说明改错了变量。再只给术语着落、句界不动,复述若过关,就证实密度才是那个变量。