「中文手写认不出,那英文手写呢」——常见直觉是字母只有 26 个,应该更容易。实际上英文手写有自己的失败模式,某些方面比中文更难,某些方面更简单。
英文手写难在哪:连笔会改变字母本身
中文手写的连笔主要发生在字与字之间,单个字的骨架常常还在。英文手写(cursive)的连笔发生在字母内部和字母之间,一笔下来 a 和 o、e 和 c、u 和 v 的差别只剩一个开口或一个附加的挑笔。
所以英文手写最典型的错误是整词错位:识别成一个真实存在但意思完全不同的词。这比中文的「认成形近字」更危险,因为看起来毫无异常。
三个额外因素:
- 印刷体与手写体字母形态不同,b、g、y 的手写和印刷几乎是两个符号
- 花体、圆体、哥特体属于装饰书写,不在可靠识别范围内
- 大小写混用与缩写(Mr.、etc.、中文里常见的「1个」夹在英文句中)会打乱判断
中文手写难在哪:字多、形近
反过来,中文的优势是上下文冗余高 —— 一个词错了,句子读不通,人很容易发现。它的难点是字形集大、形近字多(未/末、己/已、戊/戌),以及潦草时整段空白。
一句话对比:中文手写容易「认不出」,英文手写容易「认错且看不出来」。
中英混排的手写:切换处丢字
实际材料多是混排的:英文笔记里夹中文批注、公式与单位混在正文里。这类最常见的三种错法是:
- 行内较小的那种文字被整段忽略(比如中文正文里夹的手写英文变量名)
- 单位与符号丢失:℃、±、%、™,以及希腊字母
- 数字与字母互换:0/O、1/l/I、5/S、8/B
补救三招:放大到目标行占满屏宽再截(切换处的错误对分辨率最敏感);中英文区域能分开时分别截两张识别;型号、编号、邮箱、网址四类逐字对着原图核,错一个字符就完全无效。这类形近字符的完整核对清单见 识别结果里 0 和 O、1 和 l 分不清?形近字符错的成因与核对清单。
拍摄要求的差别
英文手写更吃分辨率,因为判断依据是字母的开口方向和附加挑笔,需要的像素更高。
本站的口径对手写是统一的具体数值:单行文字高度建议 10~50 像素、图片长边不小于 1000 像素。但英文的实际下限要往上取 —— 小写字母带上下伸部(h、p、g、y),三行高度里真正承载信息的可能只有一行。英文手写建议让单行高度落在 25~40 像素,比中文更宽松一档。
倾斜与反光的影响两者一样:正对纸面、光线均匀、避开反光与手指遮挡。
选入口与额度
手写文字识别 的识别范围写的是「手写中文与常见标点」。英文手写与中英混排的手写件,准确率的不确定性明显高于中文工整字迹,请把它当成取草稿的辅助而不是交付工具。
如果内容是打印的英文文档,别走手写入口 —— 印刷体用 图片转文字。
一张图片算 1 页,识别不向游客开放,注册(短信验证码登录即完成注册)一次性送 5 点、永久有效,VIP 会员每月另有 20~120 点配额(当月不结转),单次上传不超过 10 页;识别失败不扣点数。英文手写最划算的用法,是先拿一页试一次看落在哪一档,再决定整本要不要做。
一个降低返工的收尾动作
不管中英,识别完把整段小声读一遍。英文尤其有效,因为错出来的词虽然存在,但句子读起来不通。这是唯一能低成本发现「认错且看不出异常」的办法,其余靠逐字对照原图。