一份几十页的纸质合同,用「扫描件PDF转Word」能在几分钟内变成可按关键字查找的文本。它解决的是找不到,不解决读得准:条款编号是否错位、金额与日期是否与原件一致,核对责任始终在使用方。本篇不谈任何文件的法律效力问题,只讨论把纸变成可检索文本这件事的做法与边界。
先明确做不到什么
- 不还原版面。缩进、字号、加粗、边框、底色全部丢失,原本靠排版区分的主条款与子条款会变成同一层级的连续段落。
- 不做分栏还原。双栏排版的补充协议会被拉成一条长流,左右两栏文字互相穿插。
- 不提供双层(可搜索)PDF。想要「看起来还是原件、又能搜」的效果,只能影像件加纯文本两份并存。
此外,印章覆盖区域的文字与涂改重写的内容无法可靠识别;PDF 里的扫描件按每页 150 DPI 渲染成图后再识别,原件本身是低分辨率复印时损失会更明显。
一个典型失败表现
最常见的不是认错字,而是条号错挂:识别结果里「第六条」下面接的却是第七条的内容,或某条的子项被吞进上一段末尾。原因是原页面有跨页段落和悬挂缩进,切点落在了条款中间。
定位方法很具体:拿到 Word 后第一件事是逐条搜「第一条」「第二条」直到最后一页,看序号是否连续、有无重复或缺号。缺号那处就是合并发生的地方,必须回原图重录。另一处必查位置是签字盖章页前的附件清单,那里的编号最容易被丢掉上下文。更细的步骤见 纸质合同转可搜索文本的做法。
可执行的最小流程
- 判断入口。打开 PDF 看文字能否用鼠标选中复制。能选中的走 PDF转Word,效果更好且不消耗识别额度;选不中的才用识别。
- 加密先解密。加密 PDF 无法直接识别,需回到出这份文件的系统里去掉密码。
- 清掉空白页再上传。单次页数上限 10 页,空白页同样按 1 页计并扣 1 点,却不写入输出文档,容易误判为漏转。
- 拿 1 页做样张。先看断行与条号表现,再决定整本怎么处理,印刷体每页扣 1 点。
- 只做一次全文校对。重点核当事人名称、日期、金额、期限、违约条款这五类内容,其余段落抽查即可。
外发前要处理的个人信息
给外部审阅之前,文本形态比影像更容易失控,对方可以直接复制走。至少要处理:自然人身份证号、手机号、住址与邮箱;法定代表人个人信息;银行账户与开户行;正文夹带的员工名单。证件号可用 身份证打码 处理,其余字段在 Word 里手工替换成占位标记,并在文末注明部分信息已隐去。
要提醒一句:这些处理属于你自己该做的动作,不构成对文件效力或保密义务的判断。合同能给谁看,取决于你和对方之间的约定。
底线判断:识别文本适合用来查找、比对版本、做内部台账。凡要引用具体条款内容的场合,一律以双方签署的原件为准。