财务同事的经典需求:客户发来的对账单是 PDF,要进 Excel 算合计。搜"PDF 转 Excel"会冒出一堆工具,转完一看:数字东倒西歪,合并单元格全碎,比手工录入还慢。
为什么会这样
PDF 存的是每个字符的坐标,线条和数字之间没有任何"这是一个表格"的结构信息。所谓直接转 Excel,工具全靠猜——猜行列、猜单元格边界,复杂表格基本猜错。所以这条路不是工具不好,是路线本身就不通。
三条靠谱路线
路线一:先转 Word,再进 Excel(推荐)
- 用 PDF 转 Word 转换——表格结构在 Word 里更容易保留
- 打开 Word 里的表格,全选复制
- 粘贴进 Excel,用"匹配目标格式"微调
十页以内的规整表格,这条路三分钟搞定。
路线二:提取纯文本,分列粘贴
对账单、流水这类数字密集的表,结构比版式重要:
- 用 PDF 转文本 把文字提取出来
- 粘进 Excel 后,用"分列"功能按空格/逗号切开
- 删掉页眉页脚等杂质行
适合只需要数据、不在乎原始排版的场景。
路线三:数据量小就别折腾
二十行以内的表,复制粘贴到单元格里手动对齐,通常比折腾工具更快。自动化工具的价值从一百行开始。
先按表格类型选路线
同样是表格,类型不同,最省事的做法差别很大:
- 规整横表(每行一格、列数固定):走路线一,转 Word 后复制进 Excel,几乎不用修
- 含合并单元格的表(表头跨列、分类跨行):别指望自动还原结构。用路线二提取文本,只把数据取进 Excel,表头在 Excel 里重新合并,比在转换结果里找错位快
- 多页重复表(每页都有表头的对账单):先按页码范围把需要的页拆出来再转,避免把十几份表头当成数据行导进来。做法见 按指定页码提取
- 流水型数据(日期、摘要、金额三列,几百行):这类根本不需要版式,走路线二最快。文本粘进 Excel 后用分列切开,一分钟完成
- 扫描件里的表(选不中文字):所有路线都要先有识别结果。手机或微信的图片"提取文字"能应急,量大就得靠带识别功能的桌面软件,见 图片文字识别的办法
数据进 Excel 之后必做的三步
转换和粘贴只解决"把字搬过来",能算账还要三步清洗:
- 文本转数值:从 PDF 来的数字经常带不可见空格或全角字符,Excel 把它当文本,求和结果是 0。选中这列,用"分列"直接点完成,或用查找替换去掉空格,再用选择性粘贴乘 1 转成数值
- 日期与金额格式:日期可能被识别成 `2026.08.15` 这种文本,金额可能带千分位逗号变成文本。统一改成 `yyyy-mm-dd`,金额列批量去掉逗号后再设格式
- 清格式与列宽:粘过来的单元格常带一堆底色和边框,用"清除格式"只留内容,再重设列宽和表头样式。这一步做干净,后面做透视表才不会踩坑
防翻车三个细节
- 千分位逗号:粘贴进 Excel 后"1,234"可能变文本,用查找替换去掉逗号再转数值
- 合并单元格:PDF 里的跨行合并转丢是常态,进 Excel 后重新合并比重转省事
- 扫描件对账单:源文件是图片,以上两条路线都救不了,先解决 OCR 再谈表格