手头一份纸质文件要变成能编辑的电子档,最常见的失败不是识别不准,而是一开始就选错了功能:该走转换的走了识别,白花了页数;该识别的走了转换,拿出来一个空文件。
记住工具名没有用,判断顺序才有用。按下面五个问题依次问自己。
第一问:这份文件上有"能选中的字"吗
如果你拿到的是 PDF,先做这个判断。用阅读器点一下正文,能拖出选区的,是文字型 PDF —— 走 PDF转Word 之类的转换功能,不消耗识别页数;点不动、整页像一张照片的,是图片型 PDF,只能识别。判断方法和两者的代价差异见 10 秒判断 PDF 是图片型还是文字型:判错的代价是多花一倍时间。
纸质文件没有"选中"这一步,所以拍照或扫描之后一律按图片型处理。
第二问:它的主要内容是表格吗
表格结构和一段文字是两种输出。一张纸质表格,你要的是能算数的单元格,不是一段连着排的文字:
- 印刷体表格 → 图片转 Excel,输出 .xlsx
- 手写表格 → 手写表格转 Excel(这个能力只有一家供应商提供,没有备用线路)
- 表格里全是文字,本来就打算重排 → 图片转文字拿一份 TXT 反而省事
第三问:字是印上去的还是写上去的
本站面向的是印刷体。手写在纸质文件里非常常见(签字、批注、填写栏、整页手写),必须走手写三件套,而且要用可验证的说法:工整手写可用、连笔潦草明显下降、务必人工校对。返回空白时的排查见 手写识别返回空白?先排除三个原因,再判断是不是字迹问题。
第四问:你要的输出是什么
这一步决定用哪个工具,而不是相反:
- 只要文字内容(复制走、再喂给别的程序)→ TXT
- 要在 Word 里改(公文、报告、简历)→ DOCX
- 要算数、要汇总、要导入系统 → XLSX
第五问:一页里混了印刷、手写和印章
这种页很常见(表单、审批单、合同签字页)。没有任何一个工具能一次把它处理干净,正确做法是按块拆开、分次识别。拆分思路见 一页里既有印刷体又有手写和印章,识别该用哪个工具?
判断不了,就用送的 5 点试一页
不用先决定,试错成本很低:识别不向游客开放,但注册(短信验证码)一次性送 5 点、永久有效,而且调用失败的页不扣额度。用一页确认输出格式对不对,再决定整批怎么走。额度怎么算见 图片转文字免费几张?注册送 5 点、会员每月 20~120 点,还有一条容易忽略的共用规则。
最后一条边界,无论选哪个功能都成立:识别只保证文字可编辑,不还原版面 —— 分栏、表格线、图片位置、页眉页脚、字体样式都不保留。想要版面,只能识别完自己重排。