把一份双栏排的论文或报纸转成 Word,结果往往是:左栏第一行后面紧跟着右栏第一行,两段毫不相干的话被拼成了一个段落;往下越错越多,整篇变成一份读不通的文本。这是双栏 PDF 转换的头号问题,而且跟转换工具的档次关系不大——再贵的软件也一样会串行。

为什么会串行

PDF 存的是"某串字在页面坐标 (x, y)"。文字提取时按位置排序输出,而双栏页面里有两串 y 坐标完全交错的文字:左栏第 1 行和右栏第 1 行在同一水平线上。排序器按 y 先输出,就变成"左1 右1 左2 右2"——每一行都从一栏的结尾跳到另一栏的开头。

工具需要额外的线索才能识别"这是两个独立的文字块":栏间的空白带、显式的分块标记。有些文件里有,有些没有(尤其是扫描后带假文字层的、或从网页打印生成的 PDF)。所以同一个工具转 A 文件正常、转 B 文件全乱,很正常。

同类成因还有表格串行和页边注,思路一致。

方案一:一次只处理一页(最省力)

串行需要"同一水平行上有两栏文字"才发生。把范围缩到一页,很多情况下顺序就对了,因为单页内块排序更容易判定边界。

做法:用 PDF 拆分 逐页导出,每页单独转换,再在 Word 里手工设分栏排版拼起来。

适合页数少(十页以内)的情况。二十页以上逐页转再拼,成本已经超过手工重排。

方案二:转成 Word 后重建分栏(推荐给长文档)

如果转换串行严重,先让它变成"一栏通铺"的连续文本,再在 Word 里重设分栏,比在 PDF 状态下挣扎容易得多。

  1. 转换后全选正文 → 布局 → 栏 → 两栏。Word 会自动按顺序把文字流排进左右栏
  2. 关键前提:文字顺序必须正确。如果每行都左右串着,Word 分栏会把串行内容照排进双栏,一样错。这种情况下先用方案一把顺序理对
  3. 栏间距、分隔线在"栏 → 更多栏"里设,中文期刊常用 0.5cm 以上
  4. 跨栏的标题和图要单独处理:通栏标题必须设成"栏数:一栏"(选中标题段落 → 段落 → 换行和分页 → 栏数),否则会只占左半页

这条路的实质是:把版式重建交给 Word,只让转换负责取文字。 这是双栏转换最可靠的分工。

方案三:只取文字,彻底放弃版式

如果最终用途是重新排版(比如把参考资料里的内容整理进自己的稿件),根本不该转 Word:

  • 用 PDF 转文本 输出 txt。纯文本里没有栏的概念,工具通常按文字块输出,串行概率反而低于直接转 Word
  • 粘进 Word 后自己排版,一份两栏文档改成单栏阅读稿,往往比保留原分栏更好用

这是"要内容不要外形"时最快的一条路。同理,如果只要某一段,直接在阅读器里选中复制,见 Chrome 里转 PDF 的做法。

方案四:保留原样,转成图片

反过来,如果你需要的是长得跟原文一样的页面(比如把报纸某页放进 PPT 展示),那转换是错误方向:

  1. 用 PDF 转 JPG 或 PDF 转 PNG 导出页面图
  2. 图片插入 Word 或 PPT 对应位置,版式 100% 保真

缺点显然是不可编辑。只需要引用不需要修改时,这是最省事的选择。

怎么选:先问一句"要不要编辑"

  • 要编辑长文档 → 方案二(重建分栏),必要时配合方案一
  • 只要内容,会重新排版 → 方案三(转文本),最快
  • 只要看着像,不改 → 方案四(转图片),最保真
  • 就一两页 → 方案一,手工也来得及

顺带说三类特殊双栏

报纸:栏数多、字体混、标题竖排,几乎必然全乱。除了版面简单的重要文章,不建议自动转换——按方案三取文字,或直接按图片留档。

学术论文(双栏 + 公式 + 图注):图注常被排到正文里。转换后重点检查公式(多数变成图片或错位字符)和参考文献编号,见 参考文献排版的处理。

中英混排对照:左右对照翻译类文件,转出来一定串行。这类文件的正确目标是双栏表格而不是双栏文本——转换后把内容整理进一个两列表格,每行一对中英文,比修串行文字快得多。