参考文献页的排版专门跟识别作对:每条文献用悬挂缩进排两到四行,行与行之间没有空行,条目之间也没有明显分隔。识别会忠实地按行输出,于是你得到的是几百行碎片。

第一步:把断行合回去

用TXT 文本处理,它支持正则查找替换,且会告诉你命中了多少处。思路是把「不以句号结尾的行」和下一行粘起来:勾选正则表达式,查找内容填一个表示「非句号的任意字符 + 换行」的模式,替换为「同一个字符 + 空格」。这样每条文献内部被合并成一行,而条目结束处的句号会保留断行。

一次改不完就多跑几轮,命中数归零说明已经没有可合并的行。这个工具在浏览器里跑,不上传文件、不占任何次数,处理完再导出。

双栏排版的参考文献页先裁剪

左右两栏会被交替读出来,第一栏第二条接上第二栏第一条,这种错序无法用替换修复。正确顺序是先图片裁剪成左右两半分别识别,再各自合并。

第二步:识别取不到的四类信息

斜体。 期刊名、书名靠斜体标识,纯文本输出里没有样式,全部变回普通字。

上标与卷期号。 卷号常用上标,容易和相邻数字并成一行。

页码区间。 连接号有长横、半角连字符好几种写法,识别结果里常常混着三种,导入前统一替换一次。

DOI 与 URL。 里面有大量连字符、斜杠和易混字符,错一位就打不开。形近字符的成因见 识别结果里 0 和 O、1 和 l 分不清?形近字符错的成因与核对清单。

中英混排的文献还涉及另一类问题(繁体、字体缺字造成的乱码),判断方法见 中英混排、繁体字识别出来是乱码或半截英文?先分清两种完全不同的原因。

不要直接导入文献管理软件

EndNote、NoteExpress 导入需要的是标准交换格式(RIS、BibTeX),识别给你的是纯文本,两者之间没有捷径。可行的做法是把合并好的文本逐条整理成软件能识别的格式再导入,或者干脆只在原文校对阶段用它做检索底稿。

如果原文是可复制文字的 PDF,一切都省了:PDF 转文本 直接取字。判断文件类型只需十秒,方法见 10 秒判断 PDF 是图片型还是文字型:判错的代价是多花一倍时间。

最后提醒一句:识别只提供字符,不判断引用是否规范、也不核对文献是否真实存在。盲审与投稿前的引用核查仍要逐条对照原刊。