把整本书变成能复制的文字,卡住人的从来不是识别本身,而是书是立体的:纸会弯、两页会拍成一张、靠近书脊的字永远斜着。这三件事各有对应的处理顺序,顺序错了就会白扔额度。

第一步不是识别,是把对开页切开

手机一次拍下左右两页,得到的是一张横向大图。直接识别的后果是左右两页的文字被混在同一段里,跨页的句子会错位。正确做法是先切成一页一张:具体流程见 书拍成 PDF 怎么把对开页切成两页?手工裁半与拼册流程。

站内 PDF 拆分 也能按页码范围把文件切开,但它切的是页,不是同一页里的左右两半 —— 后者必须在图片阶段处理。

弯曲与书脊:这是唯一不能靠设置解决的一类

页面弯曲时,靠书脊那几毫米的字会被压扁、拉斜,甚至整行藏进阴影里。识别接口拿到的就是一张变形的图,任何参数都还原不出丢失的笔画。能做的只有两件事:

  • 拍摄时压平:用重物或夹子把页面固定住,正对纸面拍,不要斜着拍一半再指望软件校正
  • 一页拍两次:左半页和右半页各拍一张,等效于把局部放大,弯曲区的影响会明显变小

识别时的三条硬限制

扫描件PDF转Word 的口径要先看清,否则中途会被自己的额度卡住:

  1. 按 PDF 实际页数计费,每页渲染成一张图识别一次,10 页就是 10 页额度。空白页同样消耗 1 页(识别前无法预知是否空白)。
  2. 单次最多 10 页。这是同步处理的实际上限,不是保守设置 —— 页数再多会超时。一本 300 页的书必须拆成 30 批。
  3. 每页按 150 DPI 渲染,长边超过 8000 像素会等比缩小。书页这种正常排版完全够用。

输出会得到什么、不会得到什么

文档里的正文会按识别顺序逐行写进 .docx,页与页之间保留分页符。但分栏、表格线、插图位置、页眉页脚和字体样式都会丢失,页码也不会自动回来 —— 书眉上的章节名和页码需要事后用「查找替换」补。书里的照片和示意图识别不出内容,需要图片请单独用 怎么把 PDF 里的图片全部提取出来?三条路和各自的坑 那条路。

先抽三页试,再决定要不要跑全本

这是最省钱的一步。 挑正文页、图表页、靠近书脊最难的一页各一份,合计 3 页额度试一次。看清三件事:错字率能不能接受、句子被换行切碎到什么程度、弯曲页是否整段漏识。

如果抽测就漏得厉害,先回去重拍,不要急着批量提交 —— 每一轮全量识别都是真金白银的页数,而重复提交每一次都算额度。

最后提醒版权:整本书电子化涉及复制权,个人存档与对外传播是两回事,边界见 整本书的 PDF 转 Word:按章节拆分处理和版权边界 和 把 PDF 转成 Word 修改,涉及版权吗?按用途判断的四条边界。