「中文手写认不出,那英文手写呢」——常见直觉是字母只有 26 个,应该更容易。实际上英文手写有自己的失败模式,某些方面比中文更难,某些方面更简单。

英文手写难在哪:连笔会改变字母本身

中文手写的连笔主要发生在字与字之间,单个字的骨架常常还在。英文手写(cursive)的连笔发生在字母内部和字母之间,一笔下来 a 和 o、e 和 c、u 和 v 的差别只剩一个开口或一个附加的挑笔。

所以英文手写最典型的错误是整词错位:识别成一个真实存在但意思完全不同的词。这比中文的「认成形近字」更危险,因为看起来毫无异常。

三个额外因素:

  • 印刷体与手写体字母形态不同,b、g、y 的手写和印刷几乎是两个符号
  • 花体、圆体、哥特体属于装饰书写,不在可靠识别范围内
  • 大小写混用与缩写(Mr.、etc.、中文里常见的「1个」夹在英文句中)会打乱判断

中文手写难在哪:字多、形近

反过来,中文的优势是上下文冗余高 —— 一个词错了,句子读不通,人很容易发现。它的难点是字形集大、形近字多(未/末、己/已、戊/戌),以及潦草时整段空白。

一句话对比:中文手写容易「认不出」,英文手写容易「认错且看不出来」。

中英混排的手写:切换处丢字

实际材料多是混排的:英文笔记里夹中文批注、公式与单位混在正文里。这类最常见的三种错法是:

  1. 行内较小的那种文字被整段忽略(比如中文正文里夹的手写英文变量名)
  2. 单位与符号丢失:℃、±、%、™,以及希腊字母
  3. 数字与字母互换:0/O、1/l/I、5/S、8/B

补救三招:放大到目标行占满屏宽再截(切换处的错误对分辨率最敏感);中英文区域能分开时分别截两张识别;型号、编号、邮箱、网址四类逐字对着原图核,错一个字符就完全无效。这类形近字符的完整核对清单见 识别结果里 0 和 O、1 和 l 分不清?形近字符错的成因与核对清单。

拍摄要求的差别

英文手写更吃分辨率,因为判断依据是字母的开口方向和附加挑笔,需要的像素更高。

本站的口径对手写是统一的具体数值:单行文字高度建议 10~50 像素、图片长边不小于 1000 像素。但英文的实际下限要往上取 —— 小写字母带上下伸部(h、p、g、y),三行高度里真正承载信息的可能只有一行。英文手写建议让单行高度落在 25~40 像素,比中文更宽松一档。

倾斜与反光的影响两者一样:正对纸面、光线均匀、避开反光与手指遮挡。

选入口与额度

手写文字识别 的识别范围写的是「手写中文与常见标点」。英文手写与中英混排的手写件,准确率的不确定性明显高于中文工整字迹,请把它当成取草稿的辅助而不是交付工具。

如果内容是打印的英文文档,别走手写入口 —— 印刷体用 图片转文字。

一张图片算 1 页,识别不向游客开放,注册(短信验证码登录即完成注册)一次性送 5 点、永久有效,VIP 会员每月另有 20~120 点配额(当月不结转),单次上传不超过 10 页;识别失败不扣点数。英文手写最划算的用法,是先拿一页试一次看落在哪一档,再决定整本要不要做。

一个降低返工的收尾动作

不管中英,识别完把整段小声读一遍。英文尤其有效,因为错出来的词虽然存在,但句子读起来不通。这是唯一能低成本发现「认错且看不出异常」的办法,其余靠逐字对照原图。