先把边界说清楚:本站不提供对外 API,也不提供代客录入服务,没有可以给你的密钥和调用地址。这不是能力问题,是产品定位——面向「拿着手机拍了一张纸、想变成能编辑的东西」的人,不面向要跑流水线的系统。批量需求请走下面三条替代路,多数情况下比你自己搭一套对接更省。
走法一:把单次上限用满
注册用户与会员的单次页数上限都是 10 页(按物理页算)。这意味着吞吐量的第一杠杆不是接口,而是凑批:把散文件先合并成 10 页一份的 PDF,再进识别。PDF合并 属于普通转换,不消耗识别额度,非会员每天也有 5 次可用。
同样一个下午,一份份传单页做的是十几页,凑满批次传的是近百页。差别全在准备工作上。
走法二:把不吃点数的部分剥出来
很多人以为整件工作都要花点数,其实只有一小部分需要。判断动作只有一个:文字能否用鼠标选中复制。能选中的那份 PDF 走「PDF转Word」,效果更好且不消耗识别额度;只有整页是图片的才扣点。
多格式批量转换有专门的 批量转换 入口,配合 批量重命名 定序,这条链路上的操作全部不吃识别点数。先用免费通道把能做的做完,剩下的真实扫描页数常常只有原始估计数的一半不到。
走法三:把人力投到验收而不是搬运
自动化的价值在减少点击,不在减少判断。识别结果的错误很典型:编号断行、中英文之间多出空格、一行被劈成两半、金额小数点位置偏移,这几类机器不会报错,只能人眼抓。
固定动作建议这样排:一批 10 页 → 立刻抽查五处编号与金额 → 通病写进下一批的准备清单 → 成果当场下载。服务器处理的文件为临时存储,默认保留 24 小时后自动删除,已下载过的会在更短时间内清理,不要把这里当备份。
什么情况下别用本站
需要程序无人值守跑几千份的,本站不是合适的选择,去找提供正式接口的服务商,或者直接在本地部署开源识别引擎。需要对方回传结构化字段(发票代码、税额单独成列)的,这里的输出是文字与表格内容,不做字段抽取模板。涉及病历、未公开合同原件、含完整身份信息的材料,先确认单位允许外发再谈工具,本站虽然写明图片会加密发送给供应商用于本次识别且默认 24 小时清理,但「不出本机」才是更硬的标准。
需要无限批量做法的详细讨论见 无限制批量转换怎么做,额度与倍率的口径差异见 识别额度与转换次数。