OCR(Optical Character Recognition,光学字符识别)的表格这一档输出 XLSX(2007 及以上的表格文件格式)时默认按文本写入:只有能无损存成数字的内容才存为数值,身份证号、银行卡号、带前导零的工号一律保持图上那几个字。会变成 1.2E+17 的,几乎不是识别弄坏的,而是那一列被设成了数值格式。
一、为什么长数字一进表格就变形
表格软件对数值只保留有限有效位,超出部分用科学计数法显示并在末尾补零。18 位身份证号一旦被判定为数值,尾号就成了 0,而且存的值本身变了,不可逆。识别不主动做这个判断,它先把内容当文字交给你。
| 图上单元格内容 | 写入方式 | 你会看到什么 |
|---|---|---|
| 18 位身份证号 | 文本 | 原样 18 位,末位 X 也在 |
| 以 0 开头的工号、邮编 | 文本 | 前导零保留 |
| 能无损存成数字的金额 | 数值 | 可参与求和 |
| 以等号开头的一串字 | 文本 | 打开时不被当公式执行 |
二、已经变形了,按这个顺序排查
- 回到本次下载的产物直接打开。里面还是完整 18 位,说明坏在后续粘贴那一步,别重跑识别再扣点数。
- 检查目标列格式。列被设成数值时任何输入都会被强转;先改成文本再用「只保留文本」重新贴一次。
- 产物本身就少位或串行,才是图的问题,去第三节处理输入。
三、传图之前先做两件事
草单据上的编号容易缺字,不是因为它是数字,而是字太小、笔画太密、打印太淡。走 表格识别转Excel 之前:
- 把编号所在那几行裁出来放大再传,小字过密的区域整段识别最容易缺位。
- 用相册自带编辑功能扶正倾斜、拉起亮度;表格类入口不做方向纠正,页面转了 90 度要先自己转正。
四、分场景怎么选入口
- 印好的清单、台账、报价表:走「表格识别转Excel」,一页扣 2 点。
- 表里有手写填的数字或姓名:走「手写表格转Excel」,一页扣 3 点,比印刷表格高一档。
- 只要一段文字、不在乎行列:走「图片转文字」出 TXT(UTF-8 纯文本),一页 1 点。
- 图片和 PDF 混在一起的手写材料:走「手写笔记转Word」出 DOCX(2007 及以上的 Word 文档格式)。
边界说死:能保住长编号的每一位数字,不能替你判断这列该存文本还是数值,也不提供字段抽取,不会自动拆成姓名、编号、金额。
常见问题
问:识别出来的数字为什么不能直接求和?
答:那格被当作文本写入,正是不让长编号掉零;要算钱就把纯金额那几列手动改格式后再核对。
问:能一次传几十张带编号的图吗?
答:单次数量和页数有上限,见工具页提示;每张图片输出一个与原图同名的文件,不会自动拼接。
问:不登录能不能先看一眼结果?
答:不能,游客不开放识别,每一次识别都要向云服务商付费;注册后即可使用并拿到一次性赠送额度。
本站能力与限额说明
站内 表格识别转Excel,把带框线或没框线的印刷表格图片交给它,行列位置和合并单元格还原到同一个工作表;识别在服务器端完成,成品请当天下载。
不能做的是:保留边框、底色、列宽、字体样式,把单元格文字变成可计算公式,以及自动拆分字段。额度口径:每一次识别都要向云服务商付费,所以游客不开放识别,注册后即可使用;一页扣几点按能力不同(通用文字与手写文字 1 点、表格 2 点、手写表格 3 点);每日识别量有上限。具体点数余额与每日上限以 会员页 为准。
单文件上限 8MB;文件处理完保留 24 小时,到期自动清理,已下载过的更快。识别按额度点数计、不按次数计,不要把转换类的每日次数口径当成页数限制。VIP 会员单文件上限随档位提高到 20~50MB。涉密材料请自行评估是否上传。