「扫描要 300DPI」这条经验传得很广,以致很多人以为把它调到更高就能识别得更准。DPI 只是打印和排版里的换算系数,识别真正看的是每个字占多少像素。这个区别决定了你该重新扫描,还是该换个思路。
站内的固定口径:每页按 150 DPI 渲染
扫描件PDF转Word 的处理方式很明确:每页按 150 DPI 渲染成图片后识别。这个值不是随手取的:
A4 在 150 DPI 下约 1240 × 1754 像素。正文 10.5 磅的字在这个尺寸下大约 22 像素高,已经稳稳落在可用区间(手写场景给的口径是单行文字高度 10~50 像素)。也就是说,对正常排版的文档,150 DPI 已经在够用线之上。
什么时候 150 DPI 真的不够
原文件本身就是低分辨率图拼出来的。 这是最常见的情况,也是最容易被误解的:瓶颈在你的原件,不在渲染参数。一份 500KB 的 30 页扫描 PDF,多半是 96 DPI 级别的小图,按 150 DPI 渲染只是把小图放大,放大不会产生新信息。
极小字号的表格。 八磅以下、一行挤十几个数字的报表,22 像素会变成 14 像素左右,接近下限。
淡迹、铅笔字、第三代复印件。 对比度本来就低,像素不足时笔画会并成一团。这类问题加 DPI 帮助有限,加对比度更有效。
判断只要三步
- 看文件体积:一份 30 页彩色扫描只有 2MB,几乎一定是低分辨率原件
- 导出第一页看:用 PDF 转图片 导出一页,放到 100% 看字的边缘 —— 糊的是原件,锐利的是够用了
- 对照识别结果:如果是整段漏识,多半是像素不足;如果是零散错字,多半是形近字问题,加分辨率没用
正确的补救是回到源头,而不是改设置
能重扫就重扫。 扫描仪设 300 DPI 或更高,A4 会到 2480 × 3508 像素,小字号和淡迹的可用性能明显改善。
纸质原件已经不在了(旧档案、借来的书、销毁前的文件),那就没有第二条路:接受当前质量,挑重要页面单独放大识别。把一页拆成两次拍、每次只覆盖半页,等效于提高局部分辨率。
不要做的两件事:把小图用软件放大到 3000 像素再上传(信息不会增加,只会引入插值伪影);把整页 PDF 用压缩工具压得更小后再识别(每一轮有损压缩都在吃掉笔画边缘)。
一个常被搞混的点:DPI 改大不等于变清晰
在图像软件里把 DPI 字段从 150 改成 300,像素总量一点没变,只是告诉打印机排得密一点。这个操作对识别完全无效,相关讨论见 把 DPI 改成 300 就能变清晰?像素才是硬道理。
同理,站内 PDF 转图片是逐页 150 DPI 输出,想知道各种场景该要多少像素,可参考 扫描的 PDF 能转出高清图片吗?分辨率的真相 和 A4 纸尺寸是多少像素?毫米、厘米、英寸与 DPI 对照表。
最后:上限要一起记住
图片长边超过 8000 像素会等比缩小后再识别。所以「扫得越贵越好」是错的:300 DPI 对 A4 大约 2480 像素,完全在范围内,很合适;但如果扫的是大幅面图纸到了 10000 像素,反而会被缩回去。正确做法是按要识别的区域裁好再传,而不是一味堆分辨率。