想引用书上的一段话,最烦的是那几十个字既选不中也不能选。拍一张照转成文字是现在最快的取字方式,但书页有几个和文档截图完全不同的麻烦:装订处凹下去、纸会透光、两页拍进一张。

书页特有的四个难点与解法

书脊附近的弧形。 靠近装订线的字被压进凹槽,拍出来是一串被拉伸变形的字,识别最容易在这里断句。解法:把书摊平在桌上,从稍高的位置垂直拍单页,不要拍对开的两页;压不住书脊时,用干净的重物压住上页的边缘,只露出要取的那一页。

透字。 薄纸背面的字会影影绰绰透过来,识别时会被当成正文的一部分读进来。解法是在下一页里垫一张深色纸或手掌遮背面,让这一页变成单面内容 —— 这个动作对透字严重的平装书效果立竿见影。

跨页段落被腰斩。 左右两页各拍一张,段落会在一句话中间断开。这是正常的读取顺序问题,识别后手工接一次就行;批量摘录时按页编号命名图片,回来才知道顺序。

脚注和页眉混进正文。 学术书的脚注会被当成正文尾部。用 TXT 文本处理 的删除空行与查找替换清理,比在记事本里一行行删快。

走哪条路:看你是不是只有手机

只有一段话:手机拍一张,传到电脑后用 图片转文字 出 txt。一张图片算 1 页,识别不向游客开放,注册一次性送 5 点(永久有效),VIP 会员每月另有 20~120 点配额。

整本书:这条路要提前劝退。单次上传上限 10 页,一本 300 页的书要分 30 批;而且书籍扫描的排版还原问题(分栏、图表、页码)远比文字提取复杂,先读 整本书的 PDF 转 Word:按章节拆分处理和版权边界 了解代价。

只想在设备上读:手机看 PDF 字太小,还有重排和转长图两条路,见 手机上看 PDF 字太小?重排、转长图、转文本三条路。为了阅读而整本电子化,通常不值得走识别这条路。

引用时不要丢掉的两样东西

页码。 电子化后文字和原书位置就脱钩了。摘录时把页码写进第一行或最后一行,否则三个月后你无法确定它出自哪本书的哪一页,引用也就无法核实。

原图。 保留那张照片。识别会有形近字错(详见 识别结果里 0 和 O、1 和 l 分不清?形近字符错的成因与核对清单),日后核对要回到原始图像,而不是回头翻书。

版权边界:该说清楚的部分

把整本书扫描并识别成可编辑文本,这一步本身在不同用途下结论完全不同。个人摘录、引用少量段落用于学习研究,与复制整本传播,是两件事。

判断的四条边界(按用途而非按技术)写在 把 PDF 转成 Word 修改,涉及版权吗?按用途判断的四条边界。要点是:你电子化之后做了什么决定了性质,而不是能不能电子化。一段话贴进自己的笔记,和把整本书导出成文件发给别人,中间隔着一条明确的线。

一个更省事的选择

如果这本书有电子书或正规数据库版本,先去找它 —— 很多教材和网络资源本身就有文字层,见 CAJ / KDH 文件怎么打开?知网下载的论文打不开的三种解法。从可复制的源里取字,质量比拍纸页高一大截,也省掉了识别、清理、核对的全部时间。