一张拍糊了的照片,能不能靠后期救回来再识别文字?答案是看糊在哪一种。三种模糊里只有一种能救,另外两种做多少后期都不会变好,硬上只会浪费一次页数额度。

先分清是哪一种模糊

对不上焦(重影)。 笔画边缘出现双影,放大看字的轮廓本身就不完整。这种信息在拍摄时就丢了,后期无法补回来,识别多半会漏整行。

被压缩坏。 图片能看清轮廓,但笔画边缘有一块一块的马赛克。这种有救,因为字形信息还在,只是噪声多。

被放大过。 小图强行拉到很大,字边缘全是锯齿方块。放大不会增加信息,这种也没救。

判断只需把图放大到 100% 看一眼:看不清字的是第一种,看得清但难看的是第二种。

四种常见情况的处理顺序

纸面反光。 最容易被忽略的一点:反光是过曝,那块区域的像素全是纯白,字根本不存在。正确做法是换角度重拍或关掉闪光灯;后期压高光往往救不回已经死白的区域。

阴影盖住半页。 阴影是亮度整体偏低,比反光好处理:把亮度、黑场拉起来通常能恢复。处理后再送去识别。

整页发灰。 复印件、旧扫描件的通病 —— 背景不是白的。用对比度拉满或者简单的二值化处理,把背景压成纯白,识别率提升非常明显。手机自带扫描模式、手机拍的文件歪、有阴影、发灰:怎么弄成平整白底的扫描件 说的就是这件事。

字迹太淡。 铅笔字、盖章压过的字、放久的热敏纸。适度加对比能改善,但淡到肉眼要辨认的,识别也不会比你更好。

一条不能省的原则:不要重复压缩

处理流程里的顺序很重要:尽量在最原始的那张图上做一次处理,然后立刻送去识别。在手机上调一下、发给自己又被压一次、导出来再调一次,每一轮都在丢笔画细节。很多人处理三轮之后发现还不如原图,就是这个原因。

同样,把小图放大到 4000 像素再上传不会更准。本站的处理口径是长边超过 8000 像素才等比缩小,所以传大图不会失败,但也不会把丢失的细节找回来。

该手工录的时候别硬上

三类情况建议直接放弃识别:重影糊的、关键数字占主体且无法逐字核对的、以及整页只有两三行字的(后者是识别内容太少导致的常见空白结果,不是图片问题)。

具体到操作,图片转文字 的识别失败不扣点数,所以拿一张拿不准的图试一次代价很低;但如果连续几张都返回空白或全错,就不要再往下试了,换更清晰的图比换工具有效。

最后一句实话:所有预处理都是在给识别创造条件,不是在提高某个工具的准确率上限。上限由模型和内容决定,下限才由你手上这张图决定。