C5.14.2Segmentation errors cascade设计研究
字符切分错误会连锁影响后续字符的识别,一步错步步错
别名: 切分错误 · 连锁识别 · over-segmentation · handwriting segmentation
概念解释
多数识别管线先把一行墨切成字符假设,再分类。切错一刀——该断不断、不该断却断——后面的窗口全部错位:一个字被认成两个,或两个被粘成一个,再往后的字用错误的边界去认,错误像多米诺一样走。这是识别内部的结构失败,不是用户事后怎么改文本。
机制
切分靠间隙、抬笔、投影直方图或学习到的边界。连写、字距不匀、标点贴着字,都会让间隙信号失效。过切分把一个字拆开,分类器看见残缺部件,输出两个高置信的错字;欠切分把两字送给一个分类器,输出一个不存在的合体。后续解码若假设“上一个边界是对的”,就没有机会把窗口滑回去,于是一行从某一刀开始整段崩溃。语言模型可以在词级拉回来,但若切分已经把词边界也毁了,语言模型看到的是一串错长度的 token。搜索式识别(保留多个切分假设再打分)能把连锁截住,代价是算力和延迟。中文竖排、英文连写、数字串的切分线索不同,一套间隙阈值不能共用。
怎么研究
在人工切分的金标准上,分别注入过切、欠切,看后续 CER 如何从出错点向右爬升。比较贪心切分与保留多假设的搜索。
自变量:切分策略、字距、连笔程度、语言。 因变量:切分 F1、从第一刀错误起的后续 CER、搜索宽度与延迟。
只报整行 CER 会把切分灾难和单字分类错误混在一起;应按“第一刀位置”对齐再画曲线。
边界
整行作为单次序列识别、不强切字符的模型,连锁形式不同(对齐漂移),但长行仍会从某一对齐错误开始坏。单个孤立字的输入框没有切分问题。用户在格子里写(田字格)等于把切分交给布局,错误形态变成“写出格”而不是连锁。
怎么落地
- 对自由书写用多假设切分,不要把第一刀贪心结果锁死。
- 允许用户在墨上合并/拆开切分框,这是识别器的结构编辑,不是普通打字。
- 数字、密码等无词表字段更要慎切,宁可慢,不要整串错位。
- 验证:在一行中部故意写一个粘连字,看其后是否整段乱码。打开多假设后,崩溃应停在粘连附近。提供拆合操作后,人应能只修那一刀而不重写整行。