一份 32 页的 PDF,转出来 Word 只有 28 页——少了 4 页,而你可能根本没发现。缺页比排版错危险得多:排版错一眼看得出来,缺页要等到打印或交付时才暴露,而那时往往已经漏的是最关键的那页附件。
先做对账,再谈原因。
第一步:确认到底"少"了多少
页数对账:Word 里的页数和 PDF 里的页数天然不会相等。转换后行距、字号、页边距都会变,内容多寡会重新分布,32 页转出 35 页同样正常。所以对页数是无效检查。
正确的对账对象有两个:
- 首尾内容对不对:打开 PDF 翻到最后一页,看最后一段文字;再看 Word 的最后一段。结尾丢了是最严重的情况——往往是文件本身被截断
- 字符数对账:Word 里 审阅 → 字数统计,记下字符数(不含空格)。再用 PDF 转文本 输出一版 txt,统计它的字符数。两者接近说明文字内容完整;txt 明显更多,说明转换环节丢了内容
这一步花两分钟,能直接排除八成"我以为少页了"的虚惊。
成因一:那些"页"本来就不是内容页
- 纯空白页:很多 PDF 有双面打印留下的空页,转换后被合并掉,Word 少了几页但内容一个字不缺。属于正常
- 封面、目录、封底:这些页常用特殊对象绘制,可能不进正文
- 横版插页:合同、图纸中间夹的横向页,有时被当成异常页处理掉
验证方法:只对比内容首尾,不纠结中间页码。
成因二:这一页本来就没有文字层
混合内容 PDF 是最常见的真丢页场景。一份文件里前 20 页是 Word 导出的文字,中间 5 页是扫描的发票附件,后面是文字。转换时:
- 文字页正常还原
- 扫描页没有文字可提取,结果要么整页变成一张图,要么内容为空看起来像"丢了"
判断只需在 PDF 里逐页试选中文字。这类文件的处理要分开做:文字部分正常转,扫描部分单独走 OCR 路径,见 扫描件转可编辑文档的三种情况。
成因三:拆分转换时漏了范围
大文件常需要先 拆分 成几段分别转。这时页码范围填错就是丢页,而且极易发生:
- 设了 1–20、21–40,文件实际 55 页 → 41–55 永远没转
- 拆分工具的页码从 0 开始而你以为从 1 开始 → 整体错一页
- 合并回一个 Word 时漏插一段,这是最高频的原因,尤其四五个 docx 拼一份的时候
防错做法:拆分前先在纸上写下范围清单,转换后按文件名逐段核对再合并。合并多个 Word 用 Word 的"插入 → 对象 → 文件中的文字"功能,比复制粘贴快且不易漏段。
成因四:文件被截断(最需要注意)
如果 PDF 本身下载不完整,会呈现一个很典型的组合症状:开头正常、中间正常、结尾忽然断掉。
验证方式:在阅读器里跳到最后一页。打不开或提示文档已损坏,就是文件不完整。这种问题跟转换工具毫无关系——内容压根不在文件里,什么工具都变不出来,只能重新获取源文件。
一个隐蔽来源是邮件和微信传输:附件超过限制时有的客户端会截断而不是报错。
成因五:页面用了转换工具处理不了的对象
带表单域、3D 模型、图层、注释的 PDF,这些对象转不进 Word。表现为页面里那块区域空白——比如可填写的政务表单,转换后格子没了。
对策要换思路:这类文件本来不需要转 Word。表单直接在 PDF 里填写,本站的 PDF 加水印、PDF 加密 能处理交付环节;真要重做一份,用图片插入更保真,见 PDF 转 Word 后表格错位。
缺页修不回来时的兜底顺序
- 先跑字符对账,确认是真丢了还是虚惊
- 真丢了 → 换一条转换路径重跑(不同工具的解析引擎差别很大),先试 PDF 转 Word
- 只丢某几页 → 单独把那几页拆出来转,转完插回原位
- 整页本来就没文字 → 接受它转不出来,按图片或 OCR 路径单独处理
- 结尾就断了 → 停止折腾,重新拿完整源文件