C5.14.4Cursive recognition lags regular script设计研究
手写识别对连笔与草书的准确率明显低于工整的楷体书写
别名: 草书识别 · 连笔 · cursive HWR · kai versus cao
概念解释
工整楷体(或印刷体式手写)字间有间隙、笔画分离,切分和分类都容易。连笔和草书把多个字或部件拧成一条不断的线,边界消失,字形也远离训练里的标准结构。同一识别器在这两类输入上的准确率可以差出一个档位。这是书写风格对识别器的打击,不是“这个人的字与别人不同”那种一般个体差——个体差在工整书写里也存在,但连笔是结构上的另一档难度。
机制
连写消灭了抬笔和间隙,切分失去最稳的线索,不得不在一条长轨迹上猜边界。草书还改变部件形状:该封口的不封,该断的相连,分类器看到的是训练分布的远尾。英文连写把字母粘成词级形状,有时整词模型反而更好;中文草书在字内连、字间仍可能断,或完全一笔到底,两种都难。速度通常与草化相关,动态特征可以帮一点,但外观已经缺部件。为楷体优化的模型在草写上的失败不是微调几个阈值能修的,需要草写语料或明确拒绝(提示人写清楚些)。产品若用工整样本报 CER,会系统性高估真实笔记场景。
怎么研究
让同一人写楷体、自然笔记、限时草写三档,分开报 CER 和切分 F1。比较仅楷体训练与加入草写的模型。
自变量:风格档、训练数据是否含草、解码单元(字 / 词)。 因变量:分档 CER、切分失败占比、人被要求写清楚后的 CER 回升。
禁止把三档混成一个平均 CER。
边界
签名验证有时故意用连写作为身份特征,目标与通用识别相反。儿童楷体不稳,但不一定是草。艺术书法超出识别器合同,应作为图像保留而不是强认。提示“请写清楚”会改变风格,从而改变 CER,不能把提示后的数字当成自然笔记的数字。
怎么落地
- 验收语料必须含自然连笔,而不是只有誊写楷体。
- 草写 CER 明显差时,提供“按词解码 / 请写清楚”的退路,并保留墨,不要 silently 输出乱字。
- 演示不要只用楷体。
- 验证:同一段落三档风格的 CER 分列。若楷体合格、草写崩溃,产品声明必须写明范围。加入草写训练或改词级解码后,草写档应单独再测,不得用楷体数字代替。