办事时想找出「那份合同里违约金是怎么写的」,翻的是几十页扫描 PDF —— 搜索框里输入关键词,一处也找不到。这不是文件太大,是因为里面根本没有文字:一页图片对搜索引擎而言只是一个色块。

判断要不要做这一步

文字型 PDF 不用识别。 在任意阅读器里能直接选中、复制出文字的 PDF,本身已经可搜,再走识别是白花钱。分不清两种文件的先看 10 秒判断 PDF 是图片型还是文字型:判错的代价是多花一倍时间;确认是文字型后,用 PDF 转文本 直接导出即可,不消耗识别页数。

只有图片型 PDF 和照片需要这一步。 典型来源是扫描仪的「扫描为图像」、手机拍的合同、微信转发多次后变成图片的材料。

四步链路

第一步:拿到清晰的影像。 正对纸面拍、光线均匀、四角完整不裁掉,多页合同建议合成一份 PDF(图片转PDF),比几十张散图好管理。拍摄要点的展开说明见 扫描件 PDF 转 Word 在线识别的完整流程:扣页规则、页数上限与不还原版面。

第二步:把字提出来。 全文以印刷体为主的,用 扫描件PDF转Word:每页按 150 DPI 渲染后识别,页与页之间保留分页符,只保证文字可复制、可编辑,不还原分栏、表格线与字体样式。只要一份纯文本存档的话,PDF 转文本 走不通(它不做识别),可以先转图片再逐张 图片转文字 导出 TXT。

第三步:清掉识别痕迹。 识别结果最常见的两个毛病是句子被硬换行切碎和多余空行。用 TXT 处理 删除空行、去除行首尾空格,配合正则查找替换把行尾单个换行合并 —— 这一步做完,全文才会在检索时按语义命中而不是被切成碎片。

第四步:建立可搜索的存档。 把 txt/docx 与原始影像放在同一目录、用同一主文件名(文件怎么命名才方便查找?实用文件命名与整理法则),操作系统与网盘的全文索引就能搜到文字部分,点开又能看到带印章的原图。归档要求「双套」的,两套都必须留,理由见 纸质和电子“双套归档”要不要都做?怎么对得上。

哪些内容一定要留在影像里

转出的文字不能替代原件。 印章、手写签名、纸张与页码位置是合同真伪的判断依据,而识别明确不处理印章与手写(混排页的处理办法见 一页里既有印刷体又有手写和印章,识别该用哪个工具?)。金额、日期、当事人名称这三类内容必须逐字核对 —— 形近字错一个,检索出来的条款就是错的,可参考 识别结果里 0 和 O、1 和 l 分不清?形近字符错的成因与核对清单。

上传前先想清楚一件事

识别是把图片交给第三方接口处理的:文件存放在隔离的临时目录,默认 24 小时后自动删除,站内不建索引、不对外展示,但传输与识别这一环必然经过供应商。涉密合同、含大量个人信息的批量档案,请先确认单位是否允许上传外部服务,判断清单见 在线处理文件会泄露吗?在线工具的安全判断与自保方法 和 合同、内部文件转图片会被泄露吗?安全边界讲实话。