一份六十页的对账单直接丢进去,扣的是 60 × 2 = 120 点;而里面真正有表格的往往只有三十来页。多付的那一半,全花在封面、账户信息页、说明页和空白页上。识别前无法预知某页是否空白,空白页照样按 1 页计并扣对应倍率,但不会写进输出文档。
先分页分类,再决定谁进识别
拿到文件第一件事不是上传,是翻一遍给每页贴标签:
- 纯表格页:明细行整齐排列,唯一值得花 2 点的部分。
- 文字说明页:抬头、账期、联系方式、盖章区。要的信息只有一两行,走印刷体文字入口每页 1 点更便宜,甚至可以手工抄。
- 封面与分隔页:直接删掉。
- 合计页:留着当校验依据,它就是重算后的对照数。
用 PDF拆分 按页码范围切段,把表格页挑出来单独成批。单次上限 10 页(注册用户与会员一样,按物理页算),四十页表格仍要分四批做。
点数怎么排
三类内容各自的倍率是:印刷体文字 1 点每页、印刷表格 2 点每页、手写文字 1 点每页、手写表格 3 点每页。同一份对账单的最优解通常是混合方案——挑出来的表格页走表格入口,封面与条款那几页要么删掉要么走文字入口,手写签收批注单独拍照走手写入口。
六个识别工具共用一份额度,只看总余额够不够。点数不够时会在开始前整批拒绝,不会转到一半,所以每次提交前口算页数乘倍率,别按感觉试。
拆完之后仍然会错的三处
拆分解决成本,不解决准确率。三处高频错误各有独立发现法:
- 跨页断行:一页最后一行没写完,下一页接着写数量或备注,读回来变成两条记录。发现方法是看首行有没有孤零零挂在左侧的残字。
- 列数变了:不同页的栏宽稍有差异就会多出一列或少一列,合并后错位。逐页数列数,不一致的那页单独处理。
- 合计对不上:拿识别结果求和与留存的合计页比对,差额若正好等于某一行的金额,多半是那行重复或漏识。
一张图里识别出多个表格时会按顺序排列并用空行分隔,合并前必须删掉这些空行,否则公式区域会被切断。
最小流程
- 通读一遍,给每页贴标签,记下哪几页有表格。
- 删掉封面与纯装饰页,把表格页按不超过 10 页切成若干批。
- 口算每批页数乘倍率,确认余额够再做。
- 每批完成后立刻与该页的合计数字核对,不要攒到最后一起查。
- 全部批次合并前统一列名与列顺序。
什么时候别拆
页数本来就在 10 以内、且几乎页页有表的,拆分只是多一道工序,直接上传即可。加密 PDF 无法解析,要先回出文件的系统解密。本站不提供 PDF 转 Excel,也不生成可搜索的双层 PDF;如果这本对账单其实是文字型 PDF(判断方法:文字能用鼠标选中复制),直接用 PDF转Word 更好,而且不消耗识别额度。留存年限以主管部门与接收单位公布要求为准。