把字提取出来只完成了一半。TXT 文件本身不产生价值,接上后续用途才有。四条接续流程,对识别结果的要求各不相同 —— 提前知道终点,才知道前面要整理到什么程度。

路线一:清理成能用的规范文本

这是所有后续的地基。三个动作按顺序做:接断行、删重复、删空行。

工具用 TXT 文本处理,支持删除重复行(保留首次出现的位置、不打乱顺序)、删除空行(只含空格的行也算)、按 Unicode 码位或中文拼音排序、以及启用正则的查找替换。它全程在你的浏览器里完成,文本不上传服务器,处理内部材料时这点比在线工具更合适。

具体步骤和正则思路见 识别出来的文字全是断行和页眉页脚?三步清理比手工删快十倍。

路线二:并入能搜到的档案库

识别的最大收益不是省打字,是让纸上的内容进入可搜索范围。做法:

  1. 每个 txt 文件名保持和图片同名,这样任何一条文字都能回溯到原始照片
  2. 集中放一个目录,按年份或类别分子目录,命名规则见 文件怎么命名才方便查找?实用文件命名与整理法则
  3. 用系统自带的全文索引(Windows 搜索、Mac 聚焦)检索这个目录

只有图片的目录,系统搜不到里面的内容;换成 txt 之后,一次建立索引就永久可搜。纸质合同检索不到的完整链路见 纸质合同与档案检索不到内容?变成能搜的文字完整四步。

路线三:交给 AI 做摘要或改写

这条路现在问得最多,要点只有一个:先把内容变成纯文本,再喂给模型。

图片直接给多模态模型当然可以,但对长文档,纯文本更省、更准、也更容易核对 —— 你能明确知道模型读到的是哪一段。提取纯文本的两种入口:图片走 图片转文字,本身有文字层的 PDF 走 PDF 转文本,后者不消耗识别页数,能选它就不要选识别。

完整做法和 token 账见 想让 AI 帮忙总结 PDF?先提取纯文本,效率更高。

一个必须补的动作:模型不会告诉你原文里有识别错的字。摘要之前先核一遍编号、金额、日期,否则你得到的是一个「逻辑自洽但事实错误」的总结,比没有总结更危险。

路线四:结构化进表格

需要计算、排序、汇总的内容,别停在文本上。

四条路线共同的收尾动作

回到原图核关键字段。 无论走哪条,编号、金额、人名、日期这四类必须对照原始图片确认。识别接口是第三方提供的,没有任何 OCR 能保证全对。

保留原始图片。 本站的文件默认 24 小时后自动删除,识别结果不会长期存在。下载下来的 txt 和留在手机里的那张照片,才是你唯一的存档,别把临时目录当成仓库。