反复出错的就是那几对形近字符:零与大写 O、一与大写 I、八与 B、五与 S。识别完不要整段重跑,先核对长度对不对(校验码只取后六位),再把这些高危位逐个和原图比对;源头是图片时,先把号码区域裁出来放大再识,收益比换工具大得多。

一、哪些位在使坏

易混对典型场景判别线索
0 与 O数字串里混进字母真码全为数字,出现字母即错
1 与 I小字号竖线看有无上下横笔
8 与 B低分辨率扫描件B 左侧是直线
5 与 S折角模糊处真码不含字母
6 与 G印章压住的部分结合上下文位置判断

二、四步定位法

  1. 数位数:确认这一栏应有的长度,长度不对说明漏行或串行,别急着看具体字符。
  2. 挑高危位:把上表涉及的字符逐个和原图放大比对,其余位默认可信。
  3. 查干扰源:印章叠字、反光、褶皱都会让同一位置的字符反复变。
  4. 回源处理:把号码所在小块单独截出来,拉高对比度后再识一次,比重识整页准确得多。

拿到文本后,用 图片转Excel 把成批票面的号码与金额落到列里,便于和开票系统导出的清单比对;两列文本逐字找差异可用 文本对比。

三、拍摄与扫描的避坑清单

  • 别斜着拍:透视变形让竖笔画并成一片,一行全废。
  • 别开闪光灯正对铜版纸:反光区内的字符会被整段吞掉。
  • 别让号码栏占画面太窄:先保证这一行像素宽度够。
  • 别连着多次压缩同一张图:糊了就救不回来,永远在未处理的原件上做识别。
  • 别一次结果就录入:识别只给文本参考,最终以人工复核为准。

四、批量时的节奏

一次提一票的号码区域,比一次扔二十张整票更容易核对;每识一批就回填台账并标复核人。识别按页数扣额度:注册用户有一次性赠送额度,VIP 每月另有额度,每日识别量有上限,超出后次日再试或联系站长。手写单据另走手写通道,表格类按更高点数扣减。

常见问题

问:识别率能保证到多少?
答:不做百分比承诺,取决于清晰度、字号与干扰;本篇的方法是把错误控制在可复核范围内。

问:能不能直接识别 PDF 版电子发票?
答:转换类工具只处理文字型文件,图片型或扫描型 PDF 要走收 PDF 的那两个 OCR 入口。

本站能力与限额说明

站内图片转文字 把票面号码与关键字段提取成可比对的文本;转换在服务器端完成,服务器装有可匹配的中文字体,特殊字体可能回退,涉密材料请自行评估是否上传。

【识别输入不收普通 PDF,仅部分指定入口支持;不提供真伪查验与翻译服务;每日识别量有上限,超出后次日再试或联系站长】。

游客与未充值注册用户单文件上限 8MB、每天 5 次成功转换;充值 VIP 会员后单文件上限提高到 20~50MB(随档位递增),转换次数不限,各档当前售价与额度以 会员页 为准。文件处理完保留 24 小时,到期自动清理,成品请当天下载。