扫描件最大的问题是搜不到:一份 80 页的档案,想找某个合同号只能一页页翻。行业里的标准解法叫双层 PDF —— 上面一层还是原来的扫描图像,下面叠一层透明的文字。看上去和原来一模一样,但能选中、能搜索、能被索引。

原理:两层,各干各的事

图像层:原扫描的页面图,负责「看起来是什么」。
文字层:识别出来的字符,按位置对齐排在图下面,透明度设为不可见,负责「能被读到」。

关键点是这两层位置必须一一对应。这也是双层 PDF 比普通「识别成文本」更麻烦的地方:它要记录每个字的坐标,而识别输出的顺序是线性的。

必须说清:本站不生成双层 PDF

这一项能力本站目前没有做 —— 不提供把文字层写回扫描 PDF、也不提供带坐标的 OCR 输出文件。不要因为看到这一页就以为本站能一键生成可搜索扫描件。

站内能做的是把文字取出来,走另外三条路:

那「能搜到」这个目标还成不成?

成,而且对大多数人更好用。 双层 PDF 的价值在于一个文件同时满足版面和检索,但如果你能接受两个文件,效果往往更实用:

原始扫描件 PDF(保留版面与效力)+ 一份识别出的 TXT(负责搜索)。

落地做法:

  1. 扫描件按页或按份编号,PDF 存档不动它
  2. 逐份识别成 txt,文件名与 PDF 完全同名放在同一目录
  3. 用系统全文索引这个目录(Windows 搜索、Mac 聚焦)
  4. 搜到关键词后打开同名 PDF 看原样

这样「搜」和「看」各有其主:文本负责定位,PDF 负责呈现。而且比双层 PDF 多一个好处 —— 文本可以随时重新生成,原件永远不被修改。

双层 PDF 也不能做的三件事

一、双层 PDF 里的文字层,同样受识别准确率限制。 它不会比识别本身更准,而且错字被藏在一层看不见的地方,你只在搜索不到时才发现问题。

二、放大或打印时用的是图像层,文字层不会变清晰。 想提升清晰度只能回到扫描分辨率,见 扫描的 PDF 能转出高清图片吗?分辨率的真相。

三、双层文件体积比原扫描件大。 多一层带坐标的文字,页多的档案体积增加明显,发邮箱前可能要压缩,见 PDF 太大微信发不出去怎么办?四档压缩参数与三条绕行路线。

什么时候确实需要真正的双层 PDF

只有两种场景值得为它专门找工具:必须在同一个 PDF 文件里既呈现原件又能被对方系统检索(例如档案管理系统要求上传可搜索件);或者要交出的就是这一个文件,不能有附件。

如果只是自己想搜得到,上面的「同名 TXT」方案更快、更可控,也不改动原件。

一个前置动作别跳过

不管走哪条路,先确认这份 PDF 真的没有文字层。有些「扫描件」其实是半电子文件,本身就带文字,直接提取又快又准。判断方法和后续处理见 PDF 能看却不能选中复制?教你快速提取全文。