合格线只有三条:文字能选中、能改、能全文搜索;中文没有变成方框或乱码;段落顺序和原件一致,没漏行没串行。版面长得不像原件不算不合格——「扫描件PDF转Word」从来不承诺复刻版式,它交付的是文字,不是那张纸。

为什么不该期待版面还原

这个工具的做法是把 PDF 每页按 150 DPI 渲染成图,再交给识别供应商取字。取回来的是文字与换行,字号、颜色、加粗、边框、底色、列宽一概不保留,也不做分栏还原。所以转完发现标题变正文、双栏变成上下两段、表格线消失,都是正常结果,不是失败。

真正的失败长这样:整段缺失、句子中间插入无关字符、一行被劈成两半还顺序颠倒。这三种要重做,版面不像不用重做。

最常见的三种翻车表现

小字糊成一片。 输入图片文字过小,长边不足 1000 像素时容易漏识,表现是密排脚注那一块直接空白。放大原图能看到笔画已经粘在一起,这不是识别偷懒,是信息在拍摄阶段就丢了。

断行位置乱跳。 原件每行末尾都被当成独立段落,导出后一段话裂成六行。这是逐行取字的必然结果,需要用文本处理把行合并回去,见 TXT处理。

中英文之间多出空格。 数字与单位被拆开,合同编号断成两截。凡是编号、金额、日期这三处,都要回原图核对,别信看起来通顺的结果。

必须返工重拍的三种件

  • 拍歪了:本站不做透视矫正,页面四边不平行时边缘文字会被切掉,只能重拍
  • 多代复印件:复印次数越多网点化越严重,笔画细节已被抹平,识别不出来
  • 手机文档模式增强过的图:自动拉高对比度反而让笔画粘连,关掉增强用原图更好认

还有一个隐藏成本:空白页识别前无法预知,照样按 1 页计扣 1 点,却不写进输出文档。批量上传前先数一遍物理页,废页用删除页功能先清掉,见 PDF删除页面。单次上限 10 页也要求分批排产。

验收清单

  1. 全选复制到记事本,出现一串问号或方框说明字体本身有问题,回去查原文件
  2. 随机抽五处编号、金额、日期,逐字对照原件
  3. 数段落数量,与原件比对有没有整段丢失
  4. 印章与手写签字位置单独看原图,这两类内容不要指望识别

什么情况别用这条路径

需要保留原始排版的(红头文件、宣传册、带批注的试卷),转完一定失望,这类留影像件更实在。需要「可搜索又能看到原版面」的双层 PDF,本站不提供。文字型 PDF 请走「PDF转Word」,效果更好且不消耗识别额度。完整验收方法另见 扫描件转Word质量怎么查,或直接看 扫描件PDF转Word 的工具页说明。