结论先给:八百页按印刷体每页 1 点算需要 800 点,混表格会往上翻;买两个常用包(500 点 / 49.9 元,永久有效)覆盖大头。单次上限 10 页意味着至少 80 个批次,所以这个项目的真正瓶颈不是钱,是批次管理和命名规则。给自己一周做完的,几乎都是烂尾。
第零周:先做目录,不动原文件
把整摞材料过一遍,只登记三件事:起止页号、材料类型、是否有表格。产出一张清单就够。这一步不消耗任何额度,却能决定后面省下多少点数——很多档案里三分之一是空白页和重复封面,这些不该进入识别批次。
同时要定一个判定动作:文字能否用鼠标选中复制。能选中的属于文字型 PDF,走「PDF转Word」即可,效果更好且不消耗识别额度。先把这一部分剥出来,剩下真正的扫描件往往比原始估计数少一大截。
第一周:样张定参数
各类型挑一页最典型的走 扫描件PDF转Word,印刷体 1 点、印刷表格 2 点、手写表格 3 点。看四件事:小字有没有漏、编号断没断、多表格之间那个空行分隔、合计列有没有错位。
一张图里识别出多个表格时会按顺序排列并空一行分隔,合并前必须删掉这些空行,否则后续筛选会把空行当成数据起点。样张阶段就要把这个处理动作固定下来。
第二到第四周:按批推进
排产公式很简单:每批不超过 10 页,同一批内不要混类型。原因不是技术限制,而是核对责任划分——一批里既有正文又有表格时,验收人不知道该按哪套标准查。
空白页要在上传前用删除页清掉:识别前无法预知是否空白,但空白页照样按 1 页计扣 1 点,只是不写入输出文档。加密档案先回出件系统解密,加密 PDF 直接上传只会失败。
命名在上传之前做,不要在下载之后做。用 批量重命名 统一成「全宗号-目录号-页号」格式,配合每份 PDF 输出一个同名文件的规则,成果才能对得上原件。
第五周起才轮到验收
抽查比例按用途定:内部检索用可以低一些,涉及金额、人名、日期的那一列必须逐格回原图。合同金额、工资数字、报税数据建议一律回原图逐格录入,别让识别结果替你签字。
什么情况下别用本站、别付费
想让程序自动跑完八百页的,本站不提供对外 API,也没有代客录入服务,只能人工分批。指望一次会员配额吃下的也不现实:年卡每月 45 点,当月用不完不结转,这种量级就该买永久页数包。真需要接自己系统的,去找提供正式接口的服务商,别在这里绕路。项目节奏与常见返工原因的详细版见 无限制批量转换怎么做。