C5.14.3Recognition latency–accuracy tradeoff设计研究

识别延迟与识别准确率互相权衡,实时识别通常牺牲部分准确率

别名: 识别延迟 · 实时识别 · CER versus latency · partial decode

概念解释

边写边出字要求识别在笔画未完成、上下文未写完时就给出结果。等一整行再认可以用更大模型、整句语言模型和多次切分搜索,准确率通常更高,但字出不来。实时路径为了低延迟,会截断搜索、用较小模型、少看右侧上下文,于是准确率下降。这是识别器自己的时间–质量权衡,不是墨迹跟手的那几十毫秒。

机制

延迟来自等待更多墨(词边界、超时)和计算(模型前向、束搜索宽度)。实时策略包括:每笔或每字触发一次浅模型;用左侧已认结果当上下文,右侧当空;限制束宽。浅模型对草写和形近字更弱;缺右侧上下文时,英文前几个字母、中文左偏旁会过早定字,后面写完才发现要改。最终再跑一次全行模型做“冷却”可以提高定稿准确率,但屏幕上已经闪过错误,人可能已经动手改或已经被误导。把识别放到抬笔后几十毫秒的短窗,是折中:比逐笔准,比整行快。延迟对书写闭环的影响是:出字太晚,人不等,继续写,识别结果打在已经离注视点很远的地方。

怎么研究

同一引擎扫束宽、触发粒度(每笔 / 每字 / 每行)和模型大小,画 CER–延迟曲线。记录第一可见字的时间和定稿 CER(冷却后)。

自变量:触发粒度、束宽、是否二次全行冷却、设备算力。 因变量:首字延迟、实时 CER、定稿 CER、人是否在冷却前就改错。

曲线必须在目标硬件上测。服务器模型的准确率搬不到端上实时。

边界

听写式“写完一段再出全文”可以走高准确路径,不该被实时曲线绑架。离线导入的扫描件没有实时压力。算力充足时权衡变弱,但仍存在等待右侧上下文的信息权衡。过早出字若不允许改,权衡变成不可逆错误。

怎么落地

  • 实时用浅解码出候选,定稿用一次全行冷却;冷却改字要能被看见,且不打断下一笔。
  • 把“出字快”和“最终 CER”分成两个指标,不要用其中一个为另一个辩护。
  • 字段型短输入可以等抬笔再认,不必逐笔。
  • 验证:画出 CER–延迟曲线,选出产品点。关掉冷却看实时 CER 差多少;拉长等待看人是否已经写到别处。端上与服务器各测一条曲线,禁止混报。

延伸

  • 同组C5.14.1 联机识别利用笔画顺序与书写动态信息,离线识别只依赖最终图像 · C5.14.2 字符切分错误会连锁影响后续字符的识别,一步错步步错 · C5.14.4 手写识别对连笔与草书的准确率明显低于工整的楷体书写
  • 相邻C5.08 书写延迟 · C5.05 手写识别与纠错
  • 站内检索recognition latency · accuracy tradeoff · incremental decode

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C5.14.3