扫描件识别完,打开 Word 一看:要么是全空,要么是每页一张不能编辑的图。这两种症状成因完全不同,处理方向甚至相反,别一上来就重传一遍 —— 重传如果成功不了,还白占额度。
症状一:Word 能打开,但一个字都没有
最可能:这是一份真正的空白文件。 有些扫描仪会输出「有页面但没有图像内容」的 PDF,页面存在但渲染出来是白的。验证只需在阅读器里翻到第 3 页看有没有东西。空白页同样消耗 1 页额度(识别前无法预知是否空白),但不会写进输出文档。
次可能:识别接口没返回内容。 页面是图,但图里文字过少、过糊,或倾斜过大。表现是整份成功但没有文字。用 PDF 转图片 导出一页看看原始图像质量,比反复试识别有效。
第三种:内容其实有文字层,但你走错了工具。 这种情况直接转换更好,识别反而可能什么都不返回 —— 见 10 秒判断 PDF 是图片型还是文字型:判错的代价是多花一倍时间。
症状二:转出来的 Word 里全是图片,一个字改不了
这几乎可以确定是你走错了工具:文字型 PDF 用「直接转换」以外的方式处理,或者用了不识别文字的转换路径。
正确入口:文字型走 PDF转Word,不消耗识别页数;扫描件才走 扫描件PDF转Word。
这个症状的完整解释(以及为什么有些转换会「安静地成功」)见 PDF 转 Word 后变成一张图片,一个字都改不了是什么原因。
症状三:只有前几页有内容,后面全空
这是逐页失败,通常是后段页面的问题,不是整体问题。三个常见原因:
后几页是空白页或分隔页(扫描件常见,正面有内容、背页全白)。
后几页分辨率过低 —— 相机连续拍摄时后半程容易失焦,或者扫描时纸太薄、透字严重。
页面有旋转或横竖混排。整批按同一方向读取,侧放的页会当成空白。先旋转摆正再识别,做法见 PDF 页面横着、倒着看不了?在线旋转摆正。
处理办法:按页拆开分别试。哪几页转出来了、哪几页没有,一目了然,只需重做坏的那几页。
症状四:直接报错「PDF 没有可读的页面」
三种情况:
文件已损坏 —— 下载不完整、传输中断很常见。
设置了打开密码 —— 加密 PDF 需要先解密再上传,见 加密的 PDF 怎么转 Word?分两种密码,处理方式完全不同。
渲染被中断(超时或资源不足)—— 重新上传一次,若仍然失败,多半是文件本身的问题,这时先拆分再分批,见 扫描件识别一次只能 10 页?拆分批次、页码衔接与合并的正确做法。
关于扣页数的三件事
识别失败不扣点数。 供应商报错、图片无法解码这类失败,已扣的付费页数会退回。整份都没识别到文字时会报错。
空白页会扣。 因为它在识别之前无法判定。这是最容易产生「我为什么被扣了页」的地方 —— 一份 10 页里有 4 页空白分隔页的文件,仍然消耗 10 页。先删空白页能省下这部分。
同一份重复提交,每次都算页数。 所以第一次失败时不要凭直觉重试,先按上面的症状定位到原因再决定要不要重跑。
一个通用的定位顺序
翻原文件看有没有内容 → 判断它是图片型还是文字型 → 定位坏的是哪几页 → 再决定重做哪一段。 四步走完,绝大多数「转出来是空的」都能找到明确原因,而不是靠多试几次碰运气。