用 PDF 转文本 提取出来的内容,乍一看能用,细看全是毛病:每一页都插着页码和页眉,段落被硬生生切断,空行满天飞。这不是工具出错,而是 PDF 的页面结构决定的——它本来就没打算让你复制正文。

常见的三类杂质

  • 页眉页脚和页码:每一页重复出现一次,混在正文中间
  • 强制换行:原文每一行末尾都带换行,复制出来像被刀切成一行行短句
  • 多余空行:页与页之间、段与段之间留下一堆空白

三步清理法

第一步:删除重复的页眉页脚

页眉页脚每页内容相同,把粘贴后的文字放进 Word 或记事本,用"查找替换"把这段固定文字全部替换为空。页码如果是纯数字行,可以按"只含数字的整行"逐段删除。

第二步:合并被切断的段落

中文文档里,段落内部的换行属于排版换行,应全部去掉:把单个换行符替换为空,再保留真正的段落空行作为分段。英文文档注意行尾连字符(hyphen)断词,合并时把连字符一并去掉。

第三步:压缩多余空行

把连续两个以上的空行替换成单个空行,全文立刻清爽。

想少做清理,源头可以这样选

  • 只要文字内容、后续自己排版:直接提取文本,按上面步骤整理
  • 希望尽量保留原有结构:改用 PDF 转 Word,段落和标题层次更接近原文档