「我字写得潦草,能不能识别」——这是手写工具被问到最多的一句。诚实的回答是:连笔、草书、速记符号是这项能力公认的薄弱区,厂商公开的手写指标测的都是工整字迹,对连笔和草书没有公布数据。

所以下面这五个办法改善的是输入条件,不是模型上限。上限由字迹决定,你改不了。

一、让每个字占更多像素

效果最大的一个动作。手写字的连带、笔锋、收笔就是判断依据,分辨率一糊,这些细节全丢。

具体做法:凑近拍单页而不是后退拍整本;把一张 A4 分成上下两半各拍一张。单行文字高度低于 10 像素基本会漏识,25~40 像素是比较稳的区间。本站的口径是长边不小于 1000 像素,长边超过 8000 像素会等比缩小后再识别 —— 所以「拍超大图」没用,拍局部才有用。

二、一行一行拍,而不是一页一页拍

连笔字迹最容易整段返回空白。把目标行裁出来单独识别,模型的搜索空间小很多,成功率往往明显高于整页。

代价是页数:一张图片算 1 页,一页拆成 8 行就消耗 8 页。所以这一招留给最关键的几行 —— 决议、金额、责任人、签名下方那行日期。

三、把笔迹和纸面的差别拉大

淡迹、铅笔字、旧稿褪色的字,加对比度比加分辨率有效。手机相机的文档模式、手动拉高对比、把背景压成接近纯白,都能把勉强可见的笔画推到可判定的范围。

原理很简单:识别靠前景与背景的差别。差 20 级灰度时糊掉的笔画,拉开到 60 级就重新变成清晰的字形。处理成平整白底的步骤见 手机拍的文件歪、有阴影、发灰:怎么弄成平整白底的扫描件。

四、先挑一页试,再决定要不要全做

识别失败不扣点数,所以试错几乎零成本。拿一份最有代表性的页面跑一次,看结果落在哪一档:

  • 大部分对、少量错 → 继续做,人工补
  • 一半能认 → 只把它当检索线索用,正式文稿另想办法
  • 整页空白或完全不成句 → 停手,别往下试了

三十页稿子最贵的成本不是页数,是你以为能省时间、结果花三天去改错字。

五、混合分工:机器做正文,人做关键字段

识别真正划算的用法,是让它做它擅长的部分。一份潦草的记录里,通常有三分之一的内容写得相对工整(标题、条目名、数字),潦草的是连接词和快速带过的句子。

所以:全篇跑一遍 → 保留结构正确的部分 → 关键字段(数字、人名、金额)直接对照原图手工填。这比「指望识别到 95% 再去补剩下的 5%」现实得多。

一个必须给出的结论

如果原稿本身就是连笔速记,手写识别很可能认不出来,这种情况建议手工录入。 这不是委婉说法,是这类能力的真实边界 —— 换任何一家识别服务都一样。

判断要不要放弃,只需要一个数:你一眼能看清、机器认不出的比例。如果这一比例超过三成,边看边打比边改更快。

最后补一句:如果内容里表格比文字多,走错了入口会浪费很多时间 —— 画了表格线的手写内容请用 手写表格转Excel;想直接得到可编辑文档、不想在纯文本上重排,用 手写笔记转Word。两者的识别范围同样是「工整可用、连笔下降」。