判断只看一条:在这份 PDF 里用鼠标去选一行字,能框住、能复制,就是文字型,走「PDF转Word」;一格都框不住,整页像一张照片贴进去的,才是扫描件,走「扫描件PDF转Word」。两条路的代价也完全不同:前者是普通转换,不消耗识别额度;后者按物理页扣点,印刷体每页 1 点,单次上限 10 页。

为什么会有两种 PDF

PDF 本质是个版面容器,既能装真正的文字对象,也能只装一张位图。同一份合同,从 Word 直接导出的和从平板扫描仪生成的,扩展名一模一样,内核毫无关系。

本站处理这两类的方式也不同。文字型走的是格式转换,把已有的文字与版式重新映射到 DOCX;扫描型只能先把每页按 150 DPI 渲染成图片,再交给识别供应商取字。这一步决定了成本:前者烧自己的 CPU 与带宽,后者每次调用都要向供应商付钱。

走错入口的两种典型症状

该走识别却走了转换:页面提示转换成功,打开 Word 发现每个段落位置是一张横跨页面的大图,双击会跳出图片编辑框,光标根本进不去。删掉那张图,底下什么都没有。这是最常见的误判,很多人以为自己拿到了可编辑文件,改一个字才发现不是。

该走转换却走了识别:本来有完整字距 kerning 与内嵌字体的文本被重画一遍,表现为中英文之间多出不规则空格、标点位置偏移、行尾断句错位、原本连着的数字被拆成两段。更亏的是白扣点数,这份材料本可以不花钱。

三十秒判定清单

  1. 打开文件,单击任意一行正文。出现选择柄、能拖出蓝色高亮,判为文字型。
  2. Ctrl+A 全选后粘贴到记事本。出来的是通顺文字,判为文字型;出来一片空白,判为扫描型。
  3. 放大到 400%。边缘有锯齿网点就是图片;笔画始终光滑就是矢量文字。
  4. 仍不确定时,拿其中一页走 扫描件PDF转Word 做样张对比,印刷体每页 1 点,成本很低。

混合件怎么办

一份文件前半是打印表格、后半是签字页很常见。正确做法是先拆分:文字部分留一批,图片部分留一批,分别走各自入口。签字与印章那几页不要指望识别,印章内容无法可靠识别,那几页留着原图即可。

空白页也要提前清掉。识别前无法预知某页是否空白,但空白页照样按 1 页计、扣 1 点,也不写进输出文档。批量上传前先数一遍页数。

什么情况下别用这条路径

需要保留字号、加粗、颜色、边框和分栏排版的,两条路都给不了:识别只输出文字与换行,这些一律不保留,排版必须回原件处理。加密 PDF 先要解密,否则两个入口都读不出内容。量大的历史档案建议先做目录再动手,别一上来就整包上传。判定方法的更多细节见 图像型PDF与文字型PDF怎么区分,或直接查看 PDF转Word。