手写识别出来的文本,不能直接看。因为大脑会自动把错字「读对」——「会议决定十月完成」如果原文是「会议绝订十月完成」,你连读三遍也可能一个字都挑不出来。校对要换一种感官,不能沿用读文章的方式。
方法一:读出声
把识别结果小声读出来,读不通的地方就是错处。文字读起来别扭和意思读起来别扭,指向的是不同的问题:前者多半是断行错了,后者多半是字认错了。
这是四种方法里唯一能发现语义级错误的(比如「合同金额为壹万元」被识别成「台同金额为壹万元」,眼睛扫过去毫无异常,读出来立刻卡住)。缺点是最慢,适合一页一页做。
方法二:只核四类字段,其余扫读
不要试图逐字比对全篇。手写稿里真正会出事的内容非常集中:
- 数字:金额、数量、日期、电话、编号
- 专有名词:人名、单位名、地名、产品型号
- 否定词与程度词:不、未、无需、暂缓、立即 —— 这几个字丢了,意思整个反过来
- 责任与动作:谁做、什么时候交
这四类逐个对照原图,其余正文用读出声带过去。手写数字的识别错误率明显高于印刷体,这是所有手写材料里最该花时间的地方。
方法三:左右对照改,而不是先看后改
正确姿势是原图在左、文本在右并排放,一次只看一个字段的两边。
反过来做(先看一遍文本,再凭印象去图里找)是最低效的,因为你的短时记忆会把错字保留成「对的样子」。
改的时候直接在识别出的 txt 上原地修改,别重打一遍 —— 重打会把正确的那 80% 也重新引入新的错字。改完用 TXT 文本处理 做一次删除空行和去重,把整理和校对分开做。
方法四:让第二个人只看关键行
重要材料(合同、决议、通知)不要一个人定稿。给第二个人的任务不是「再读一遍」,而是只核那四类字段,一人 5 分钟足够,而且他不知道你在哪里心虚,反而更容易发现你看不出来的错。
整理成稿的顺序
校对完到能用之间还有几步,按这个顺序做:
- 接断行:手写一行到纸边就换,句子会断。用正则把非句末标点的换行接回去,做法见 识别出来的文字全是断行和页眉页脚?三步清理比手工删快十倍
- 删无用的行:页码、涂改痕迹、边角的字
- 补结构:小标题、条目编号(识别不会保留你的缩进和箭头)
- 最后再读一遍出声
什么时候不该走识别
三种情况,识别加校对的时间会超过直接手打:
- 整页都是连笔速记。识别成别字的概率太高,改错比重新打更费神
- 只有两三行字。取图、上传、下载一套下来的时间已经超过打这几个字
- 内容涉及金额且没有第二人可核。错一位就是一个数字进了账,风险不对等
判断只要 1 分钟:拿代表性的一页先试。手写文字识别 识别失败不扣点数,试错成本几乎为零;而结果是空白还是半对半错,本身就告诉你这份稿子该走哪条路。
最后要说明的是:这些方法都是在降低出错概率,不是把准确率提到某个数字。手写识别没有任何厂商能保证全对,「务必人工校对」不是免责话术,是这项能力的组成部分。