真实的纸质文件很少是「纯印刷体」:申请表右下角有手写姓名,合同末页盖着公章,审批单上一行印刷标题配三行手写意见。想一次全提出来,结果通常是三部分都不完整 —— 因为这三类内容走的是不同的识别模型。

每一类的能力边界

印刷体正文:走 图片转文字 或 扫描件PDF转Word。这两页的限制都写明:印章、数学公式、图纸线条无法可靠识别。

手写内容:必须走手写工具 —— 手写文字识别、手写笔记转Word、手写表格转Excel。反过来也一样:把整页手写稿丢进印刷体工具,识别率会明显掉下来。

印章与签字:本站不做证件、印章与签名专用识别。公章是环形排布的红字,签名是连笔,两者都不在通用模型的目标场景内。能识别出部分字符,但不能当成可靠的字段提取。

混合页的实际表现

同一页里,印章覆盖到的印刷文字最容易整块丢失:章的红色压住笔画后,二值化时那片区域的对比度被抹平,接口往往直接跳过或输出乱字。位置在页面中下部的「盖章处」文字,是漏识的高发区。

手写批注混在印刷体里时,通用工具通常能认出工整的一两个字,连笔则识别为空。输出看起来正常、少了一整句 —— 这比报错更危险,因为你不会注意到缺了内容。

分流处理的操作顺序

  1. 先按主要内容跑一遍:正文是印刷体,就用印刷体工具出全量文字。
  2. 把含手写的区域单独裁出来,用手写工具再识别一次。手机裁剪后放大上传即可 —— 手写场景的可用区间是单行文字高度 10~50 像素、长边不小于 1000 像素。
  3. 两处结果手工合并。这一步省不掉,因为没有任何一种输出格式会把「这段来自印刷、那段来自手写」标注出来。
  4. 印章与签名字段直接留空手填。需要的是「有无盖章」「签名是谁」,这类判断交给人比交给模型可靠。

如果目标是「这份文件有效」而不是「文字可复制」

那识别就不是正确方向。扫描件转文字后,原件的证据属性已经丢失:印章、签名、纸张都是判断依据,而输出只剩文字。归档要求同时保留原件影像,做法见 纸质和电子“双套归档”要不要都做?怎么对得上,复印件标注见 “本件与原件相符”怎么标才算数?复印件标注四要素。

同理,把签名图片描成线条是另一件事 —— 那是矢量描边的场景,见 图片转CAD,与识别文字无关。