「准确率 98%」这类数字谁都写过,但它回答的不是你真正关心的问题。你关心的是:这一批文件识别完,我能不能不校对就交出去。

先算清这个百分比意味着什么

厂商口径通常是字符级准确率,测试集是扫描条件良好的标准文档。把它换算到一页纸上:

  • 98% 的字符准确率 = 每 50 个字错 1 个
  • 一页 800 字的正文,就是大约 16 处错
  • 也就是说,「整页一个字都不错」的概率很低,哪怕字符级准确率高达 98%

再叠加两个现实:你的原件不是标准样本(拍照、倾斜、透印、复写),以及错误集中在数字、字母编号、姓名这些最要命的位置。同一页里的「的、是、在」错一个不影响阅读,账户号错一位就是错的。

所以任何承诺「百分之百准确」的说法都不可信,包括本站的文案 —— 我们只用可验证的表述,手写场景写的是「工整手写可用、连笔潦草明显下降、务必人工校对」,不给百分比。

十页抽样自测,二十分钟做完

不要凭感觉判断,也不要整批校对完才发现不能用。步骤:

  1. 从这一批里随机抽 10 页,要包含最差的那几页(不要只挑清楚的)
  2. 全部识别,逐字校对,每处错按三类记录:漏字(原文有、结果没有)、错字(认成了别的字)、串行(顺序或分栏错乱)
  3. 数出这 10 页的总字数与三类错误数,算出各自的比率

三类错误的处置完全不同:漏字要改拍摄条件(字太小、对比度低);错字要留校对环节,重点看形近字符,见 识别结果里 0 和 O、1 和 l 分不清?形近字符错的成因与核对清单;串行要改流程 —— 分栏页先裁剪再识别,靠参数调不出来。

按用途决定校对强度,而不是按百分比

  • 只为检索定位(在旧档案里搜一个词):允许错字,只要能搜到再去原件看。基本不用校对
  • 要做二次编辑(转成 Word 改稿):错字会留在正文里,需要通读一遍,比逐字校对快得多
  • 数字、金额、编号、姓名、日期:无论抽样结果多好,必须逐条对原件,这三类错了没有补救
  • 对外提交或作为凭据:不能只依赖识别,需要以原件为准重新制表

影响自己那批文件表现的六个因素,按拍摄、原件、处理三段列在 图片转文字识别不准?决定准确率的六个因素,前三个在按下快门前就定了。

测出来很差时,先别怪识别

按顺序检查三件事:图片长边是否达到 1000 像素以上、是否正对纸面(透视变形会让整行字被压扁)、是否走错入口(分栏页用图片转文字必然串行,扫描件里的表格页应改走 表格识别转Excel)。这三条能解释大多数「惨不忍睹」的结果,剩下的才轮到笔迹与原件质量。