PDF 转 Word 后的"乱码"其实是三类完全不同的故障,被笼统叫成了同一个词。先看乱码长什么样,就能直接定位原因——搞反了会白折腾半天,比如给编码错位的问题去装字体,永远装不好。

对照:三种乱码形态与对应病因

形态一:文字变成方框 □□□ 或空白,但选中后复制出来是正常字。
病因是字体缺失。字符的编码信息完好,只是本机没有对应字体来绘制它。复制粘贴能出正确文字,就是最确定的证据。

形态二:变成一堆无规律的生僻字,比如"锟斤拷""烫烫烫"、或者"å½å"这类带变音符号的字母。
病因是编码错位(字符集解释错误)。这类文字能正常显示、笔画清晰,但读不通。"锟斤拷"是 UTF-8/GBK 反复错转的经典标志。

形态三:部分字正常,个别字变成问号 ? 或小黑块。
病因是特殊字符超出字体覆盖,常见于生僻姓名用字、少数民族文字、数学符号、emoji、旧字形。

修形态一:装字体,别改文档

这是最容易修的一类:

  1. 在 Word 里选中乱码段落,看字体名称栏显示的是什么字体(比如"方正书宋_GBK"、"Source Han Sans")
  2. 把这个字体装上(个人电脑上从字体网站下载;公司电脑走 IT 申请)
  3. 重启 Word,方框就会变成正常文字

注意:如果乱码只出现在部分段落,多半是原文档混用了多种字体,需要对每段分别确认。不要在 Word 里直接全选改成宋体——虽然能立刻显示正常,但字号、字重、标题层级会一起被冲掉,改完的文档反而更难看。

在线转换场景下还有一种情况:字体在服务器上就找不到,转换时被替换成了默认字体。这种"字体已被替换"的结果无法在本地反推回来,只能重新排版。所以重要文件的字体核对要在转换前做,见 PDF 转 Word 后字体变了怎么修。

修形态二:换转换路径,不要修文件

编码错位意味着文字信息在提取环节就被解释错了。逐字改回正确内容是错误做法,几百字的工作量之外,你不知道哪些字被换错过。

正确处理是换一条提取路径重转:

  • 换工具。不同工具用的 PDF 文字提取引擎差别很大,同一个文件 A 转出来乱码、B 转出来正常,是很常见的现象。先试 PDF 转 Word 工具
  • 换目标格式验证。用 PDF 转文本 输出一版 txt:如果 txt 里文字正常,说明提取没问题、是 Word 端排稿坏了;如果 txt 里也乱码,说明这个 PDF 的文字编码本身就有毛病,任何工具都救不了,只能按图片处理
  • 从源头要 Word 原件,见 PDF 和 Word 的区别

修形态三:接受替换,改排版不改字

生僻字、符号问号属于字体覆盖不足,装常规中文字体没用(宋体黑体本来就不含生僻字)。可行做法只有两条:

  1. 装覆盖大的字体,比如思源宋体/思源黑体,它们包含的汉字范围远大于系统默认字体,人名生僻字多半能显示
  2. 显示不出来的字改成图片:把那个字单独截图,以图片形式插入 Word。用于公文、判决书这类不能改字的场合

数学符号、上下标丢失,则属于转换中格式信息被丢弃,需要在 Word 里用公式编辑器补,或直接从原 PDF 截图对照重打。

四步排查顺序(照着走)

  1. 选中复制,粘到记事本 → 文字正确就是字体问题(形态一)
  2. 复制出来也乱 → 编码问题(形态二),换工具重转
  3. 只乱个别字 → 字符集问题(形态三),装大覆盖字体或截图补
  4. 三条都试过仍不行 → 先确认这文件是不是扫描件,没有文字层的文件所有表现都像"乱码",判断方法见 PDF 转 Word 后变成一张图片

预防比修复便宜

转换前先做两件事:在 PDF 里复制一段文字粘到记事本,确认能出正常中文;看文件属性里的字体列表(阅读器 Ctrl+D / 文件 → 属性 → 字体),里面标着"未嵌入"的字体,就是你转换后最可能出问题的那批。这两步花三十秒,比转完再排查快得多。