会。 PDF 里的空白页同样按 1 页计算、扣 1 点;表格入口每页 2 点。原因是系统在识别完成之前无法预知这一页到底有没有字,只能按物理页统一计费。它唯一的好处是空白内容不会写进输出文档——你拿到的文件里没有那一页,但点数已经消耗。想真正省下这部分,只能在上传前动手清页。
为什么不能事后判断空白再退点
看起来只是一张白页,机器判断的成本并不低:一页浅灰底的公司信纸、一页只有页眉线和页脚页码的过渡页、一页字迹极淡的背面透印,肉眼认为空白,实际含有可读取的像素。反过来,一页看着干净却藏着印章和手写批示。要按内容动态决定收不收费,等于要求系统在识别前先做一次全页扫描——那本身就是一次调用。所以规则只能定成按页计,把选择权交给使用者:你先看一遍,删掉不要的,再上传。
哪些页面几乎可以确定该删
- 双面扫描的背面残留页:单面纸走双面进纸器,每隔一页多一张空白。整本一半点数花在这里。
- 分隔页与封皮内衬:档案装订时夹的彩色隔页,扫描后是一页纯色。
- 只含图章或签名而无正文的页:这类内容本来就识别不出可靠文字(印章属于明确不做的范围),付了钱也拿不到结果。
- 重复扫描页:同一页拍了两遍,第二遍往往更糊。
- 纯影像页:X 光片、照片、图纸截图。这些需要的是图像归档,不是取字。
一份六十页的合同附件里挑出二十页这种垃圾很常见,先数一遍再算总需求,差额通常比你想的大。
三步清页最小流程
- 用「删除页面」或「提取页面」把批次重构成一个干净文件。工具在 /pdf-tools#pdf-remove-pages,加密件需先解密。
- 只想留少数几页时改用提取,比逐页删除快得多,避免数错页序。
- 清完再看一眼总页数,确认没有超过单次上限(注册用户与会员均为 10 页),超了就先拆批。
处理后再进识别入口,扫描件转 Word 的入口见 /ocr-tools#scanned-pdf-to-word。
图片类材料同理
「图片转文字」「表格识别转Excel」只接受图片格式,不接受 PDF,一张图就是 1 页。空白或废图混在一堆照片里时,靠删除文件本身来省点,别指望系统替你筛。拍照时顺手把废片删掉,成本几乎为零。
底线判断:清页这件事的收益只在大批量、混合内容时才明显。三五页的独立文件没必要折腾,预处理的时间比省下的点数贵。当你手里是一份几十页、双面扫描、夹杂隔页的老档案时,先花几分钟清页是唯一划算的动作。