能修,但两类问题的解法相反,混着做只会更糟。第一类是词与词之间的空格丢失,输出像一串没有断点的字母;第二类是行尾的连字符把单词拆成两半,中间还夹着一个换行。处理顺序必须是先接行尾断词、再补词间空格、最后才删空行,反过来会把已经分好的词重新粘上。

分清你遇到的是哪一种

症状 A:整段挤在一起。 出现「Inatimeof」「Hedidn」这种连续辅音串。原因是课本字号小、行距密,识别在字距紧的地方没能切开词。这类错误不会只影响一处 —— 某行开始粘连时,通常整页都粘。

症状 B:满屏孤零零的连字符。 英文排版为了对齐右边行宽,会在行尾用连字符拆词(例如 under-stand 被分到两行)。识别忠实照抄,于是留下一个悬空的减号和一个换行。判断方法:搜一下有没有以减号结尾的行,有就是这一类。

最容易被忽略的是第三种混合状态:同一个词既有行尾连字符又被粘到下一个词上。这时单独处理任何一类都会失败,必须两步都做完再看结果。

三步清干净

  1. 并行尾断词。贴进 TXT处理,勾选正则,把「行尾连字符加换行」替换成空。这一步一次跑完全篇,执行后会显示命中处数,拿这个数和肉眼数的行尾减号对一下,差太多说明模式误伤了正常带连字符的复合词(如 well-known),那部分要手工还原。
  2. 接被拆开的句子。中文句内没空格所以判断容易,英文不行 —— 这里改用另一条依据:上一行末尾不是句号、问号、叹号时,多半该和下一行接起来。同样用正则处理,只在整段是连续正文时用,列表和对话体不要跑这一步。
  3. 通读补空格。词间空格丢失没有安全的自动解法,任何按大小写或词典自动切词的作法都会把人名、缩写切坏。人工过一遍即可,粘连处通常集中在几行。

顺序记成一句口诀

最后删空行、去行首尾空格,为的是下一步贴进别的软件不再错列。固定顺序记成一句:接断词 → 接断行 → 删空行 → 手工补空格。

中英混排的课文要另说

双语对照页最常见的问题是中文译文和英文原文交替出现,逐行接合时会跨语种粘连 —— 把英文行的末尾接到下一行中文开头。解法是先把两种语言的行分开处理,可以按行首是不是拉丁字母粗筛,也可以直接裁图分块各识别一次,入口是 图片转文字。

生词表如果同时想做成表格,别再走文本这条路,见 表格识别转Excel。文本只给你一行一词的顺序内容,格子的边界要靠表格识别去推断。

底线判断:只要这篇课文要用于朗读跟读或听力配合,就不要依赖识别结果。发音标注、重音符号、省略号这些细节一旦出错,孩子会照着错的读。真正的替代路径是问一句能不能拿到电子课本 —— 有电子版就用「PDF转文本」导出,一个字都不会错,也不消耗识别额度。