一张 8000 像素高的长图,比一张 1200 像素的图更容易识别失败。听起来反直觉,但原因很简单:图片总像素不代表字有多少像素。识别能不能成,看的是每一行字占多高。
一条硬门槛:单行文字 10~50 像素
站点的口径写得很明确:单行文字高度建议 10~50 像素,图片长边不小于 1000 像素。低于 10 像素,笔画之间的空隙就合并成一团黑了,人和机器都认不出来。
常见的三类内容正好都卡在这条线附近:
- 聊天记录长图:手机屏宽约 1080 像素,正文中文一般 15~20 像素高 —— 勉强够用,但转发压缩一轮就掉到线以下
- 整页 A4 缩略图:把 A4 塞进 800 像素宽的图里,正文只剩 7~9 像素,必然漏识
- 密集参数表、股票五档、报表截图:字号本身就小,一屏几十行,行高常常只有 12~14 像素
判断只要 10 秒:把图放大到 100%,量一下一个字的高度。自己一眼能看清而机器认不出,是模型或内容类型的问题;自己也要眯眼看,就是这一条。
有效的取图方式:只截你要的那几行
这是提升最大、成本最低的一个动作。
不要截整页再缩小,而是放大后分几次截。 网页和文档在浏览器里 Ctrl 加号放大到正文占满屏宽,然后按屏截图,一次一张,传几张识别几张。同样的内容,这样得到的每一行字都有 25~40 像素,识别率远高于一次塞进整页。
长截图工具生成的超长图也一样:先按逻辑段落切成几张,比原样上传更好认,而且切图不影响内容 —— 单张图太长时浏览器展示和后期处理都麻烦,具体可参考 多张截图怎么拼成一张长图?聊天记录、网页都能用 里的分辨率换算思路,反着用就是拆分。
尺寸的上限也要知道
长边超过 8000 像素会等比缩小后再送去识别。也就是说,超大图不会失败,但也不会更准 —— 缩小这一步会把你多出来的分辨率直接抹掉。所以「拍一张 1 亿像素的原图上传」这条路是白费的,按需要的区域截小图反而更好。
单文件大小另有限制:免费 8MB,VIP 月卡 20MB、半年卡 30MB、年卡/银卡/金卡 50MB。长图很容易超 8MB,先压缩再传,做法见 一次要传几十张照片?批量压缩省时不翻车。
一次传几张、什么时候必须拆
一张图片算 1 页,识别不向游客开放,注册(短信验证码登录即完成注册)一次性送 5 点、永久有效,VIP 会员每月另有 20~120 点配额(当月不结转),单次上传不超过 10 页。把一张长图切成 6 张,就消耗 6 页 —— 这个账要在动手前算,别切到 30 张才发现额度不够。
还有一类内容不是分辨率问题
密集表格截图就算你截得再清楚,走普通图片识别也只会得到一串没有行列的文字。有表格线的必须换入口,用 表格识别转Excel,它会先重建行列结构再读单元格。手写的小字笔记则要改用 手写文字识别,理由见 手写识别和印刷体识别是两个不同的模型:为什么不能拿一种入口转另一种内容。
顺序记下来:先保证每行字够高 → 按区域拆图 → 有表格线换入口 → 关键数字逐字核对。这四步做完,绝大多数「识别不全」的情况都已经解决了。