这是真实的两难:拼成一张只用一次额度,分开识别要花好几次。但省下的点数和丢掉的文字不在同一个秤上。先把计费规则说清楚,再谈怎么选。
点数是按图片张数算的
扣点倍率是这样的:印刷体文字每张图 1 点,手写文字每张图 1 点,印刷表格每张图 2 点,手写表格每张图 3 点。一张图片永远算 1 页,哪怕里面塞了十屏聊天、三个表格。所以把 6 张截图拼成 1 张长图,识别时只扣 1 点而不是 6 点,这个差值是实打实的。
另外两件独立的事别混:单次最多 10 页限制的是这一次提交几个文件,与每页扣几点无关;余额不足会在开始前整批拒绝,不会转一半。
拼接的代价:密度
拼接本身不改变宽度,只是把几段上下接起来,于是长边急剧变长。这里撞上一条硬规则:图片长边超过 8000 像素会被等比缩小后再识别。6 屏聊天记录竖着接起来很容易过这条线,缩完之后的实际字号可能直接跌破可识别范围。就算没超线,也有另一层风险 —— 单行文字在整张长图里占的高度太小,识别会漏掉一部分行。
错位是第二种代价。自动拼图按相似度对齐,纯色背景和重复行间距会让它滑半行,某一行被劈成上下两截。识别读出来的是两个半句,你会以为是漏字。定位方法很简单:打开输出文本找有没有成对出现的半截句子,再看长图对应位置。
什么时候该拼,什么时候该分开
适合拼成一张的情况:内容是连续正文(小说章节、通知全文)、字号正常偏大、各屏宽度一致、你只需要一个可搜索的文本档而不追求逐字完整。这时 图片拼接 之后走一次「图片转文字」,1 点收工。
必须分开识别的情况:原文有密集小字或参数表;屏幕分辨率不一致(不同手机截的图);内容有横向差异(横竖屏混着);缺一个字就要返工的合同、票据、名单。分开拍多张反而更好 —— 每张只装半屏,字显得更大,密度问题解决得最彻底,代价只是多点几次额度。
一个可执行的最小流程
- 先数页数并估算总长度。若拼接后长边大概率过 8000 像素这条线,直接放弃拼接。
- 用「图片拼接」合成长图,放大检查接缝处有没有把某一行劈开。
- 拿其中一段做样张单独识别一次,确认这套图的字号够用。
- 样张没问题再提交整张长图;样张已经掉字,就改成逐屏分别识别。
- 输出文本合并后用 TXT处理 删空行、去重复行,接缝处的重复一句会被自动清掉。
判断小字能否识别的更多细节可以看 长截图与小字识别。
底线判断
点数便宜、时间贵的时候才值得拼;一旦内容涉及金额、姓名、编号,多花几点换完整的行是明显划算的买卖。别为了省 5 点交付一份缺字的文本,那意味着有人要逐行回原图补 —— 那是几十分钟的事。