F4.10.6CJK truncation information density设计研究

中文单字信息密度高,同样字符数截断丢失的信息更多

别名: 中文截断 · 汉字信息密度 · morphographic density

概念解释

拉丁字母大多是语音碎片,一个字母几乎从不单独成义。汉字是语素文字,一个字常常就是一个语素。同样留下十二个字符,英文残句往往还握着词干(Quarterly r…),中文残句可能已经丢掉了句子的宾语。汉字截断的信息密度(CJK truncation information density)说的是:按「字符个数」或按从西文标题抄来的宽度预算去切中文,丢掉的不是等量信息。

机制

每个汉字占用接近一个全方角,拉丁字母平均更窄,所以同一像素宽度里中文容纳的字符更少——密度更高,预算还更紧,损失叠了两层。中文没有空格给引擎当切词边界,按西文词边界算法切,会把「北京」切成「北…」,残字比 Quart… 更不像一个可识别单位。标题若把关键对象放在后半句(「关于××的通知」),保头切尾会专门吃掉对象。把英文产品里 maxlength = 20 或「前两行摘要」原样搬到中文,表面上字符预算相等,语义预算已经不等。

怎么研究

取同一语义的中英标题对(不是机翻占位)。分别按相同字符数截、按相同像素宽截,做条目指认。看的是两种预算下中文条件相对英文条件掉了多少正确率。再加一档:禁止把双字词从中切开。若这一档把中文正确率拉回接近英文,损失就主要来自切在语素内部,而不是来自「中文更难读」。

边界

日文混有假名,假名是音节文字,密度低于汉字,不能把汉字结论直接套到整段日文。韩文音节块是字母拼成的,表现更接近拼音文字。中文标题里夹大量拉丁专名或数字时,局部密度会下降。这不是让中文无条件多占两行的礼貌问题,是计量单位选错了;若版面以像素宽为真约束,应在这个约束下重测中文,而不是把字符上限当跨语言常数。

怎么落地

  • 不要把英文表单的字符上限原样套到中文标题、摘要、列表名。
  • 卡片标题优先换行,省略当作窄屏下的退路;真要省略,用真实中文标题而不是拉丁占位去标定能留下几个字。
  • 检查切口:若省略号前是一个显然被劈开的双字词,把切点挪到词前。

延伸

  • 同组F4.10.1 截断位置决定剩余信息是否可用 · F4.10.2 中段省略保留首尾特征 · F4.10.3 被截断内容需有完整查看的入口 · F4.10.4 关键决策信息(价格、警告)不应被截断 · F4.10.5 截断后的文本仍需在辅助技术中可读取完整内容 · F4.10.7 多行截断的行数限制需随字号变化重新计算而非固定像素高度
  • 相邻F4.06 中西文混排 · F4.03 行长
  • 站内检索CJK truncation · information density · morphographic

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/F4.10.6