用 PDF 转文本 提取出来的内容,乍一看能用,细看全是毛病:每一页都插着页码和页眉,段落被硬生生切断,空行满天飞。这不是工具出错,而是 PDF 的页面结构决定的——它本来就没打算让你复制正文。
常见的三类杂质
- 页眉页脚和页码:每一页重复出现一次,混在正文中间
- 强制换行:原文每一行末尾都带换行,复制出来像被刀切成一行行短句
- 多余空行:页与页之间、段与段之间留下一堆空白
三步清理法
第一步:删除重复的页眉页脚
页眉页脚每页内容相同,把粘贴后的文字放进 Word 或记事本,用"查找替换"把这段固定文字全部替换为空。页码如果是纯数字行,可以按"只含数字的整行"逐段删除。
第二步:合并被切断的段落
中文文档里,段落内部的换行属于排版换行,应全部去掉:把单个换行符替换为空,再保留真正的段落空行作为分段。英文文档注意行尾连字符(hyphen)断词,合并时把连字符一并去掉。
第三步:压缩多余空行
把连续两个以上的空行替换成单个空行,全文立刻清爽。
想少做清理,源头可以这样选
- 只要文字内容、后续自己排版:直接提取文本,按上面步骤整理
- 希望尽量保留原有结构:改用 PDF 转 Word,段落和标题层次更接近原文档