S2.08.2Chinese collation methods设计研究

中文可按拼音、笔画或部首排序

别名: 中文排序 · 拼音排序 · 笔画排序 · 部首笔画排序 · Han collation

概念解释

中文排序方式(Chinese collation methods)不是一个单一的“汉字字母表”。同一批汉字或中文名称可以按普通话拼音、总笔画数,或部首后接剩余笔画数等方案组织;实际产品还可能采用注音、字形码、专名读音或机构自己的目录规则。CLDR 为中文提供多种 collation type,并为其中若干顺序提供可用于索引分桶的标记。简体中文 locale 常回退到拼音 tailoring、繁体中文 locale 常回退到笔画 tailoring,是 CLDR 的默认选择,不是所有中文用户、地区和任务都必须接受的唯一默认。

机制

拼音顺序把汉字映射到读音权重,适合读者已知普通话读音的查找;多音字、姓名异读和非普通话读音使“从字形自动推断读音”存在歧义。笔画顺序依赖总笔画及后续 tie-breaker,允许不知道读音的读者从字形进入,但不同字形传统与计数约定必须一致。部首—剩余笔画顺序利用 Unihan 的 radical-stroke 数据先按部首、再按余笔排列,对字典式检索有意义,却要求读者识别取用部首。三者产生的相邻关系和索引标签不同,因此显示排序、桶边界与导航标签必须来自同一个 tailoring。搜索可同时接受汉字、拼音或其他转写,而记录身份仍应使用稳定 ID;拼音字符串或部首笔画码都不是可靠主键。

怎么研究

评估时应先说明目标群体、地区、字形传统和任务,而不是只比较算法耗时。可让参与者在同一组联系人、地名或术语中分别按拼音、笔画和部首定位目标,记录首次命中时间、错桶、改用搜索以及是否知道读音或部首;多音字、罕见字、简繁异体和非中文字符要单独分析。工程验证可把选定 CLDR tailoring 的完整排序和索引标记作为版本化基准,并为人工指定读音的专名建立覆盖测试。研究结论只适用于所测读者与资料类型:熟悉字典部首的群体和在手机通讯录中找姓名的群体,策略可能完全不同。

边界

“拼音、笔画或部首”描述的是一组可选方案,不意味着三者能互相无损转换,也不意味着任何一种普遍最佳。汉字的读音可能随词语、方言和姓名约定变化;自动转写若缺少词境或人工元数据,会把条目放进用户意料之外的桶。笔画与部首排序依赖采用的字形和数据版本,简体、繁体及异体字不应凭代码点猜测。含拉丁字母、数字、假名或表情的混合列表还需要脚本顺序和溢出桶策略。若业务有法定名录或既有纸质索引,产品约定应优先明确并接受目标用户验证。

怎么落地

  • 根据内容和查找任务提供明确命名的排序方式,如“拼音”“笔画”“部首—笔画”;若产品只提供一种,也要在帮助与测试中说明采用的 locale、字形传统和 tailoring,而不是称为“中文默认”。
  • 调用成熟的 Unicode/CLDR 排序实现,不用代码点、UTF-8 字节、手写首字母表或不完整汉字映射代替。对姓名等专名允许保存经确认的排序读音,并保留原文显示。
  • 从所选 collation 的索引标记生成桶:拼音可用 A–Z 边界,笔画用笔画数标签,部首—笔画用部首标签;切换排序方式时同步重排内容、重建桶并更新当前导航状态。
  • 将汉字原文与稳定记录 ID 作为权威数据;拼音、部首和笔画值只做可重建的派生检索字段。用多音字、罕见字、简繁异体、混合脚本和空桶验证排序与导航没有分叉。

延伸

  • 同组S2.08.1 字母顺序随语言不同 · S2.08.3 大小写与变音符号影响排序结果 · S2.08.4 索引导航需随语言切换
  • 相邻S1.03.2 同一字符在不同地区有不同字形 · S2.05.1 姓与名的顺序与数量不固定
  • 站内检索Chinese pinyin collation · stroke collation · Unihan radical-stroke

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/S2.08.2