掉的是像素,不是字。长边超过上限时图片会等比缩小后再识别,WEBP 和体积偏大的图还会先重编码成 JPEG。本来只有一两个像素宽的笔画经过这两道处理就并成一片,识别端拿不到形状,只能整段跳过。
一、三次降质是怎么叠上来的
| 环节 | 对图做了什么 | 对小字的影响 |
|---|---|---|
| 拍摄或导出 | 决定原始笔画粗细 | 源头,最值钱的一次机会 |
| 上传前你手动压缩 | 分辨率与细节一起掉 | 可完全避免的损失 |
| 站内格式处理 | WEBP 与大图重编码成 JPEG | 边缘出现块状噪声 |
| 尺寸控制 | 长边超上限时等比缩小 | 极细笔画直接并色 |
一句边界:能自动把过大的图缩到可处理的尺寸,不能把已经糊掉的笔画还原出来。所以任何「先压一遍再传」的操作,都是在替系统提前做那次损害。
二、按这个顺序排查为什么少了一段
- 打开原图放大到 100%,看丢的那一段字有几个像素高。发虚、笔画粘连就是源头不足。
- 看是不是浅色:淡灰说明文字、浅蓝底纹、褪色的复印件,都属于对比度不足。
- 检查格式:WEBP 或体积明显偏大的图,一定经历了重编码。
- 检查长边:手机原图长边常常超出上限,等比缩小后小字最先牺牲。
- 最后才怀疑入口选错:印刷小字走通用线,带手写笔迹才走手写线。
三、真正有效的三个做法
- 裁块分批传。把一张 A4 上的密集小字裁成上下两块,每块长边变小、不需要缩放,笔画保住了。代价是多算一页点数,裁的时候别留整张白图。
- 换 PNG 上传。截图和扫描件存成 PNG,跳开有损重编码这一环。
- 提高源图分辨率。重新导出或重新拍摄是唯一能让笔画变粗的办法,站内没有任何增强功能。
调对比度、加锐化这类手机滤镜救不回浅字:它们改变的是观感,不是丢失的采样信息。
四、分场景怎么选
- 合同里的脚注和小号条款:裁成两条横带分别传给「图片转文字」,比整页传更完整。
- 表格里的浅灰印刷字:走「表格识别转Excel」前先转正,行列错位会让小字更难对上。
- 复印件整体偏淡:重新复印一份颜色更深的原件,或在光照充足处重拍。
- 手写小字:连笔、字迹过密过淡时准确率明显下降,手写数字错误率高于印刷体,金额、数量、编号必须逐个核对。
五、别做这几件事
- 不要为了上传快而压缩图片,8MB 的单文件上限足够容纳绝大多数文档照片。
- 不要反复重传同一张糊图,输入不变结果就不变,重试不改变任何像素。
- 不要把两页拼进一张图,每页有效分辨率减半,小字掉得更多。
常见问题
问:多小的字就一定认不出?
答:不给具体像素数,也不承诺准确率百分比;判断方法是放大到 100% 看笔画是否粘连,粘了就必掉。
问:浅色水印那行字有办法吗?
答:能识别与底色有明暗差的字,不能识别几乎与底色同色的字,只能从源头上加深重印或重拍。
问:分批裁图会不会多扣点?
答:会,一张算一页,但换来的是不缺段;缺段重做的成本通常更高。
本站能力与限额说明
站内 图片转文字,裁好块、存成 PNG 的图片从这里上传。成品当天下载。
能力边界:能把图上可见的字读成文字与换行,不能放大细节、不能增强模糊、也不能还原分栏、表格线与字体样式。每一次识别都要向云服务商付费,所以游客不开放识别,注册后即可使用;一页扣几点按能力不同(通用文字与手写文字 1 点、表格 2 点、手写表格 3 点),每日识别量有上限,价格一律以 会员页 为准。
单文件上限 8MB,VIP 会员随档位提高到 20~50MB;文件处理完保留 24 小时到期自动清理,已下载过的更快清理。识别按额度点数计、不按次数计。涉密材料请自行评估是否上传。