OCR(Optical Character Recognition,光学字符识别)里的表格这一档判的是字的位置,不是线的有无:没画框线、只有几条横线、甚至只靠缩进分栏的表,都能按行列排进 XLSX(2007 及以上的表格文件格式)。它不能做的是替你把挤在一起的列拆开——相邻列间距过近、一格内容跨两行时会并列或串行,这属于输入层面的问题,要改图而不是换入口。
一、列是靠什么对上的
识别拿到的是一堆带坐标的文字块:横向看起始位置聚成几簇就是几列,纵向看基线落在同一行的就是一行。所以图上有没有方格并不关键,关键是同一列的字大致对齐。
| 你手上的样子 | 能不能排上 | 说明 |
|---|---|---|
| 完整框线的印刷表 | 能 | 最稳,行列直接对上 |
| 只有横线的账目表 | 能 | 横线不参与判断,竖列靠对齐 |
| 完全没有线的清单 | 能 | 靠字的水平位置聚类 |
| 列与列只差几个字宽度 | 容易并列 | 两列被合成一列 |
| 一个长句占了整行宽度 | 容易串行 | 后一列被推到下一行 |
二、列错位了按这个顺序排查
- 先确认真的错位。打开产物看是不是整行右移;只有个别行长出界,多半是那格本身写了长句。
- 量列间距。用相册自带编辑功能放大看,相邻两列空白不足一个字宽时就要人为拉开:把图裁成左右两块分别识别,事后自己拼。
- 转正再传。表格类入口不做方向纠正,整页倾斜会让行的基线散开,看起来就像列乱了。
三、什么样的无框线表最容易翻车
- 手写填的那几列:字高忽大忽小,行的基线本来就不齐,这种要走「手写表格转Excel」,一页扣 3 点。
- 底色深字浅的截图:对比度不足会掉字;透明底图片会先铺白底再拍平,这步不用你处理。
- 字号极小的备注列:文字过小最容易整段缺字,宁可裁出那块放大后单独传。
四、分场景怎么选入口
- 印刷表格,有线无线都算:走 表格识别转Excel,一页扣 2 点,不收 PDF。
- 表里有手写数字或签名:走「手写表格转Excel」,一页扣 3 点。
- 只想当文字读、不在乎分不分列:走「图片转文字」出 TXT(UTF-8 纯文本),一页 1 点。
能力边界一次说死:能认没画框线的表,不能替你决定哪一段该切在两列之间。另外两件明确不做的事:不提供字段抽取,不会自动拆成姓名、编号、金额;不保留边框和列宽,识别到的是单元格里显示的文字,不是可计算公式。
常见问题
问:只有横线没有竖线,会不会全挤成一坨?
答:不会,横线不参与判断,列是按字的水平位置聚出来的,只要每列起始位置有差别就能分开。
问:能一次传多张这样的表吗?
答:单次数量和页数有上限,见工具页提示;每张图片输出一个与原图同名的文件,不会自动拼成一张大表。
问:要不要先登录才能试一张?
答:游客不开放识别,因为每一次识别都要向云服务商付费;注册后即可使用并拿到一次性赠送额度。
本站能力与限额说明
站内 表格识别转Excel,把有框线或没框线的印刷表格图片交给它,还原行列位置与跨行跨列的合并单元格;识别在服务器端完成,成品请当天下载。
它不保留样式、边框、底色、字体、列宽,也不给可计算公式和字段抽取。额度口径:每一次识别都要向云服务商付费,所以游客不开放识别,注册后即可使用;一页扣几点按能力不同(通用文字与手写文字 1 点、表格 2 点、手写表格 3 点);每日识别量有上限。具体点数余额与每日上限以 会员页 为准。
单文件上限 8MB;文件处理完保留 24 小时,到期自动清理。识别按额度点数计、不按次数计,别把转换类的每日次数口径理解成页数限制。VIP 会员单文件上限随档位提高到 20~50MB。