扫描件转 Word 之后发现"全乱了",这不是识别失败,是输出的本来就不是版面。想套进单位的红头模板、报告模板、公文模板,得先接受这条限制,再用四条补救做法把排版时间压到最低。

为什么模板一定会丢

扫描件转Word 的处理路径是:PDF 逐页转成 150 DPI 的图片 → 识别图片上的文字 → 把文字写进一份同名 DOCX。全程只有"字"这一层信息,所以输出里没有分栏、表格线、图片位置、页眉页脚、字体字号和加粗,只有文字本身,外加每页之间一个分页符。

一句话:排版信息在识别那一步就被丢掉了,任何工具都无法"保留"一份没被读出来的东西。 如果某个服务的结果看起来原版原样、却号称按页免费转成可编辑 Word,值得先做个检查:在输出文件里点一下正文,选不出字,说明它输出的其实还是图片。

补救一:在模板里开工,不要反过来

常见错误做法是先转 Word、再把模板往结果上套 —— 结果是一份带着杂乱空行的文件,改到最后比新建还慢。

正确方向是反过来:打开单位模板 → 另存为新文件名 → 把识别文字按块"粘贴 → 只保留文本"。这样标题样式、页眉页脚、行距、页边距全部由模板提供,你只负责搬运内容,一次都不用调格式。

补救二:清理那些分页符

识别稿每页都插了一个分页符。模板若是连续排版,这些分页符会让每页末尾出现大片空白、并莫名多出空页。在 Word 里开"显示编辑标记"逐个删掉,别用查找替换批量删所有分页符 —— 卷首、附件这类需要强制分页的位置也会被删。

另一处容易误会的规则:空白页同样消耗 1 页额度(识别前无法预知这页有没有字),但空白页不会写进输出文档。所以"页数对不上"通常不是漏识别,而是那几页本来就是空白。

补救三:表格不要从 Word 里补

在 DOCX 里手工画表格线是最花时间的一步。表格类内容另走 表格识别转Excel 拿到 .xlsx 再整块粘进模板:

  1. 表格用表格识别,正文用图片转文字,两条路各拿一份文件
  2. 粘贴用"选择性粘贴",选无格式文本还是保留源格式,取决于模板是否要求统一字体
  3. 粘进来的数字是按文本写入的,要求和值得先转数值:图片转 Excel 后数字不能求和?按文本写入是故意的

补救四:识别不出来的位置先放占位符

印章、手写签字、公式、图片、页眉页脚都不会出现在识别结果里,漏掉它们最常见的后果是交出去之后才发现少了一项。套完模板后立刻在对应位置插入显眼的占位文字(例如"此处为公章位置"),再全文搜索"占位"逐个替换或删除 —— 用占位符代替记忆,比校对正文省事得多。

套不动的两类版式

  • 多栏排版(报纸、双栏制度文件):识别只输出文字顺序,栏与栏的关系已经丢失,只能重排
  • 竖排文字:面向印刷体识别,竖排和古文不在可靠范围内

这两种情况如果确实需要"看起来和原件一样",更实用的做法是原件影像作附件、识别文字作正文,而不是硬套模板。

一个必须说清的合规提醒

红头文件、带公章的证照、带签名的合同,模板能套,章和签名不能重建。这类材料对外提交时以原件扫描件为准,不要提交一份"看起来一样"的套模板文件 —— 版式一致不等于文件有效,风险也不在识别环节,在提交环节。

如果原件本来就是文字型 PDF(能选中字),完全不需要走这一圈,直接转换效果更好且不消耗识别页数,判断方法见 10 秒判断 PDF 是图片型还是文字型:判错的代价是多花一倍时间。想反过来把一份现成报告做成可复用的模板,做法不同,见 把 PDF 报告改成可复用的 Word 模板:去内容、留结构的四步做法。