先给一句必须接受的话:扫描件转 Word 不属于"格式转换",它属于"文字识别"(OCR)。PDF 转 Word 的工具对扫描件无能为力,因为文件里根本没有文字可搬——每一页就是一张照片。

这决定了"免费"这个词在这里的含义完全不同:OCR 的算力成本远高于格式转换,所以没有哪家公司能免费无限提供高质量中文 OCR。下面四条路都能做到"不花钱",但每条都用另一种成本换掉了钱。

先确认:你这文件到底是不是扫描件

十秒钟的选中测试,在浏览器里打开 PDF 试着选一句话:

  • 能拖出蓝色高亮、复制出来是正常文字 → 不是扫描件,直接走转换,见 PDF 转 Word 免费方法
  • 一点就选中整页 / 完全选不动 / 放大后边缘发虚有网点 → 扫描件,往下看

还有第三种最常见:混合文件——正文是文字,中间夹了几页扫描的发票或签字页。这种要分开处理,文字部分正常转换,扫描部分单独走 OCR。

路径一:手机自带(免费、量大、质量意外地好)

这是目前中文场景性价比最高的一条路,因为识别能力是系统或大厂免费给的。

iPhone / iPad:相册打开扫描页 → 长按文字区域("实况文本")→ 全选复制 → 粘到 Word。识别准确率高,对手工排版的印刷体几乎不用校对。 缺点是每次只能处理一屏范围,十几页文件要做几十次复制。

安卓:多数品牌相机和相册有"提取文字";微信的"提取文字"是最容易忽略的工具——把扫描页当图片发给文件传输助手,点开图片 → 长按 → 提取文字,中文识别质量相当不错,还能直接复制或翻译。

成本形态:不花钱,但页面多时体力成本极高。三五个页面用这个办法最划算,五十页就别勉强了。

路径二:操作系统自带(免费,但只适合英文)

Windows 的"单击要操作"(Snipping Tool 里的文本动作) 和 PowerToys 的 Text Extractor,都是系统级免费 OCR,屏幕截图上直接取字。

中文支持要提前确认:Windows OCR 需要单独安装中文语言包,且中文识别准确率明显低于英文。英文扫描件、表格里的数字,这条路很好用;中文长文档不建议。

路径三:在线 OCR(免费额度 + 质量最好,但要挑)

在线 OCR 服务普遍采用"免费额度 + 超量付费"模式。看清三件事再决定用不用:

  1. 额度是按页还是按次。 "免费 50 页"和"免费 5 次"是两个概念,一份 60 页的文件用后者一次都传不上去
  2. 超出部分的价格。 常见套路是前几页让你免费试,跑完流程后按页收钱。先看单价再看额度
  3. 输出格式。 能出 docx 的、只能出 txt 的、能保留排版的、只吐文字的,四种价格差好几倍

本站的 PDF 转 Word 工具不做 OCR,工具页 FAQ 里明确写了"扫描版不能保证"。这是能力边界的诚实说明,不是限制——没有文字层的文件,任何转换工具给不了你可编辑文字,见 PDF 转 Word 后变成一张图片。

路径四:本机开源(免费、离线、要肯折腾)

Tesseract OCR 是长期维护的开源方案,支持中文语言包,可在本机命令行处理,文件完全不出机器。

优点很明显:真免费、无限次、离线,对涉密或不能外传的文件是唯一选择。

代价要说清:

  • 中文准确率明显低于手机那两条路。字体清晰规整的印刷文档能用;带倾斜、模糊、印章遮挡、表格线穿字的会大量出错
  • 表格基本不保留结构,输出是文字流
  • 要装运行库、配中文语言包、写命令。会用命令行的人花一小时能搭好,不会用的人会卡在第一步

四条路都不划算的情况

几百页的扫描件。 老实说:这时候最省钱的路径通常不是找工具,是回头向来源要电子版。

具体判断:一份 200 页扫描件,无论走哪条免费路径,"识别 + 全文校对"的时间都在十几个小时以上——而中文文档校对 OCR 错误是必须的,因为错一个字可能在关键处(金额、日期、姓名)。花二十分钟请对方重发一份可复制的文字版 PDF,几乎总是更便宜。

表格密集的扫描件。 表格 OCR 是所有识别任务里最难的一类,跨行跨列、稀疏填写的内容识别结果基本不可直接用。这类需求建议直接按图片存档,或在 Word 里重建空表手工填。

手写体。 四条路对中文手写体的准确率都很低(远差于印刷体),不要抱期待。

走完 OCR 之后的两件事

其一,一定要校对。 OCR 输出的文件在金额、日期、编号、人名这几类位置上错得最有杀伤力,而这些位置在扫描件里恰好是最容易糊的。校对时优先看这四处。

其二,做完转成 PDF 交付。 OCR 结果排版必然不规整,要发给别人或存档时 转成 PDF 定住版式,需要限制修改再用 PDF 加密。

一张速查表

  • 三五页中文扫描件 → 路径一(手机或微信提取文字),最快最准
  • 英文扫描件 → 路径二(系统自带)
  • 几十页、格式复杂、能上传 → 路径三,先看清页额度再传
  • 不能外传的文件 → 路径四(本机 Tesseract),或干脆手工录入
  • 几百页 → 先想办法要电子版,再考虑 OCR

更多分类判断和处理思路见 扫描件转可编辑文档的三种情况。