直接说结论:竖排内容无法可靠识别,站内六个识别工具都面向横排中文。想拿到可用的正文,只有一条折中路 —— 按列裁开、逐列识别、手工合回原序。三步都要动手,而且每一列截图单独算一页、单独扣点,一版几十列就是几十页。
整页丢进去会发生什么
最常见的不是「出不来」,而是出来一堆看着像但顺序全乱的文字。具体三种表现:
- 横向扫描式输出:把同一水平高度上、分属不同列的字当成一行读,第一列的第一个字和第二列的第一个字被拼在一起,全文变成没有意义的字串
- 每列内部颠倒:认出了竖排结构,但按从左往右排列列序,结果首尾列互换,读起来像随机段落
- 繁简与异体混出:古籍常用字形的部件被就近匹配成现代字形,出现半简半繁的混合结果
判断方法很省事:拿输出结果去搜篇名里连续三个字。搜不到说明列序错了,能搜到但中间夹生僻怪字说明字形猜错,两种都得重来。
逐列取字的六步操作
- 摆正页面再拍。手机与文字走向平行,歪斜会让相邻两列在裁切时互相渗字。
- 用 图片裁剪 从最右边那一列开始切。竖排的读序是从右往左,先切右列才不会拼的时候倒回来。
- 每列单独存一张,命名带序号,例如 01、02,合并时靠文件名排序就不会乱。
- 检查裁出的每条长条。长边不足 1000 像素时小字容易漏识,而单列截图天然是细长条,很容易踩这条线 —— 宁可保留整列上下多一点的空白凑长度。
- 一次传一列进 图片转文字,印刷体每页扣 1 点。
- 把所有列粘到一个文件里,贴进 TXT处理 删空行、去行首尾空格,再按序号通读拼接处。
拼接处才是真正会丢字的地方
上一列末尾和下一列开头之间不会有任何提示,缺一个刻本里的页码或题名行,就会吞掉十几个字。所以合完必须回原图对一遍每列字数是否接近。
什么时候别走这条路
手写批注、朱丝栏、有印章压字的版面不要试。印章覆盖的部分本来就识别不了,红色批注又会污染黑字;这类页面留影像比取字更实际。
如果只需要少量引文 —— 比如课文里的一段 —— 手打比逐列截图便宜得多。逐列拆这套流程适合的是几十页以上、且确实没有电子版的材料。真有电子版,PDF 里的文字型页面直接用「PDF转文本」导出,一个字都不会错,也不消耗额度;判断只看文字能否用鼠标选中复制。
底线判断:要的是能读的文本,还是能查的关键词。前者可以慢慢做;后者不必逐列拆,直接把整页存成图片归档更快,只是这些字搜不出来而已。