反复出错的就是那几对形近字符:零与大写 O、一与大写 I、八与 B、五与 S。识别完不要整段重跑,先核对长度对不对(校验码只取后六位),再把这些高危位逐个和原图比对;源头是图片时,先把号码区域裁出来放大再识,收益比换工具大得多。
一、哪些位在使坏
| 易混对 | 典型场景 | 判别线索 |
|---|---|---|
| 0 与 O | 数字串里混进字母 | 真码全为数字,出现字母即错 |
| 1 与 I | 小字号竖线 | 看有无上下横笔 |
| 8 与 B | 低分辨率扫描件 | B 左侧是直线 |
| 5 与 S | 折角模糊处 | 真码不含字母 |
| 6 与 G | 印章压住的部分 | 结合上下文位置判断 |
二、四步定位法
- 数位数:确认这一栏应有的长度,长度不对说明漏行或串行,别急着看具体字符。
- 挑高危位:把上表涉及的字符逐个和原图放大比对,其余位默认可信。
- 查干扰源:印章叠字、反光、褶皱都会让同一位置的字符反复变。
- 回源处理:把号码所在小块单独截出来,拉高对比度后再识一次,比重识整页准确得多。
拿到文本后,用 图片转Excel 把成批票面的号码与金额落到列里,便于和开票系统导出的清单比对;两列文本逐字找差异可用 文本对比。
三、拍摄与扫描的避坑清单
- 别斜着拍:透视变形让竖笔画并成一片,一行全废。
- 别开闪光灯正对铜版纸:反光区内的字符会被整段吞掉。
- 别让号码栏占画面太窄:先保证这一行像素宽度够。
- 别连着多次压缩同一张图:糊了就救不回来,永远在未处理的原件上做识别。
- 别一次结果就录入:识别只给文本参考,最终以人工复核为准。
四、批量时的节奏
一次提一票的号码区域,比一次扔二十张整票更容易核对;每识一批就回填台账并标复核人。识别按页数扣额度:注册用户有一次性赠送额度,VIP 每月另有额度,每日识别量有上限,超出后次日再试或联系站长。手写单据另走手写通道,表格类按更高点数扣减。
常见问题
问:识别率能保证到多少?
答:不做百分比承诺,取决于清晰度、字号与干扰;本篇的方法是把错误控制在可复核范围内。
问:能不能直接识别 PDF 版电子发票?
答:转换类工具只处理文字型文件,图片型或扫描型 PDF 要走收 PDF 的那两个 OCR 入口。
本站能力与限额说明
站内图片转文字 把票面号码与关键字段提取成可比对的文本;转换在服务器端完成,服务器装有可匹配的中文字体,特殊字体可能回退,涉密材料请自行评估是否上传。
【识别输入不收普通 PDF,仅部分指定入口支持;不提供真伪查验与翻译服务;每日识别量有上限,超出后次日再试或联系站长】。
游客与未充值注册用户单文件上限 8MB、每天 5 次成功转换;充值 VIP 会员后单文件上限提高到 20~50MB(随档位递增),转换次数不限,各档当前售价与额度以 会员页 为准。文件处理完保留 24 小时,到期自动清理,成品请当天下载。