PDF 分两种:里面装的是文字,还是一张张图。这两者的处理方式完全不同,判错的代价很具体 —— 该用直接转换的走了识别,白花钱还拿到更差的结果;该用识别的走了直接转换,转出来是一份只能看不能改的文档。
方法一:鼠标选一下(最快,10 秒)
在 PDF 阅读器里按住鼠标拖过一段文字。
- 能选中、出现蓝色高亮、能复制 → 文字型
- 选不中,或者一次性把整页选成一个大框 → 图片型(扫描件)
这是唯一需要 10 秒的方法,也够用了。
方法二:看文件是怎么来的
来源基本决定了类型:
几乎一定是文字型:Word、WPS、Excel 导出的 PDF;网页打印成 PDF;系统生成的电子发票、银行回单、社保缴费证明。
几乎一定是图片型:扫描仪扫出来的、打印机复印并输出的、手机拍照合成的、相机直出的。
混合型最容易翻车:电子文档打印后再扫描、扫描件上贴了电子生成的附件页、合同正文是扫描件而签字页是照片。这种文件里一部分有文字层、一部分没有,判断不能只看第一页,要翻到最后几页各选一次。
方法三:看体积和放大效果
两个辅助线索:
放大看边缘。 放到 400%,文字边缘有锯齿、笔画发虚的是图片型;边缘始终锐利的是文字型(矢量或文本渲染)。这一条比看体积可靠。
体积反推。 一份 30 页纯文字的 PDF 常常只有几百 KB;同样 30 页的彩色扫描件动辄 20MB。所以「一个 40 页的文件有 30MB」几乎可以断定是图片型。但这一条只能反推不能正推 —— 高分辨率的黑白扫描件也可以很小。
方法四:查有没有文字层(最准)
用 PDF 转文本 对整份文件试一次:导出的 txt 有内容,说明至少部分页面有文字层;导出是空的,说明整份都是图。
这个方法对混合型文件特别有用:把文件按页拆开后逐段试,就能定位哪几页有文字、哪几页是图。
判完之后走哪条路
文字型 → PDF转Word。排版还原靠的是文件里已有的文字与坐标信息,效果好,而且不消耗识别页数。加密文件要先解密,见 加密的 PDF 怎么转 Word?分两种密码,处理方式完全不同。
图片型 → 扫描件PDF转Word。每页按 150 DPI 渲染后识别,按实际页数扣额度:识别不向游客开放,注册(短信验证码登录即完成注册)一次性送 5 点、永久有效,VIP 会员每月另有 20~120 点配额(当月不结转),单次上传上限 10 页。
只要文字不要文档 → 图片型走 图片转文字(PDF 要先逐页导出图片),文字型直接 PDF 转文本。
混合型 → 按页拆开后分头处理,这是唯一不亏的做法。拆分方法见 一个 PDF 怎么拆成多个文件?按页拆分教程。
最后提醒一件最容易忽略的事
判错类型是后果延迟显现的错误:直接转换一个图片型 PDF 通常不会报错,它会安静地给你一个「每页一张图」的 Word,你以为转换成功了,直到要打开发现一个字都改不了。这个症状的完整解释见 PDF 转 Word 后变成一张图片,一个字都改不了是什么原因。
所以转完之后第一件事不是排版,是选中一段文字试试能不能改。这个动作 5 秒,能省下你后面所有返工。