OCR(Optical Character Recognition,光学字符识别)里的表格这一档判的是字的位置,不是线的有无:没画框线、只有几条横线、甚至只靠缩进分栏的表,都能按行列排进 XLSX(2007 及以上的表格文件格式)。它不能做的是替你把挤在一起的列拆开——相邻列间距过近、一格内容跨两行时会并列或串行,这属于输入层面的问题,要改图而不是换入口。

一、列是靠什么对上的

识别拿到的是一堆带坐标的文字块:横向看起始位置聚成几簇就是几列,纵向看基线落在同一行的就是一行。所以图上有没有方格并不关键,关键是同一列的字大致对齐。

你手上的样子能不能排上说明
完整框线的印刷表能最稳,行列直接对上
只有横线的账目表能横线不参与判断,竖列靠对齐
完全没有线的清单能靠字的水平位置聚类
列与列只差几个字宽度容易并列两列被合成一列
一个长句占了整行宽度容易串行后一列被推到下一行

二、列错位了按这个顺序排查

  1. 先确认真的错位。打开产物看是不是整行右移;只有个别行长出界,多半是那格本身写了长句。
  2. 量列间距。用相册自带编辑功能放大看,相邻两列空白不足一个字宽时就要人为拉开:把图裁成左右两块分别识别,事后自己拼。
  3. 转正再传。表格类入口不做方向纠正,整页倾斜会让行的基线散开,看起来就像列乱了。

三、什么样的无框线表最容易翻车

  • 手写填的那几列:字高忽大忽小,行的基线本来就不齐,这种要走「手写表格转Excel」,一页扣 3 点。
  • 底色深字浅的截图:对比度不足会掉字;透明底图片会先铺白底再拍平,这步不用你处理。
  • 字号极小的备注列:文字过小最容易整段缺字,宁可裁出那块放大后单独传。

四、分场景怎么选入口

  • 印刷表格,有线无线都算:走 表格识别转Excel,一页扣 2 点,不收 PDF。
  • 表里有手写数字或签名:走「手写表格转Excel」,一页扣 3 点。
  • 只想当文字读、不在乎分不分列:走「图片转文字」出 TXT(UTF-8 纯文本),一页 1 点。

能力边界一次说死:能认没画框线的表,不能替你决定哪一段该切在两列之间。另外两件明确不做的事:不提供字段抽取,不会自动拆成姓名、编号、金额;不保留边框和列宽,识别到的是单元格里显示的文字,不是可计算公式。

常见问题

问:只有横线没有竖线,会不会全挤成一坨?
答:不会,横线不参与判断,列是按字的水平位置聚出来的,只要每列起始位置有差别就能分开。

问:能一次传多张这样的表吗?
答:单次数量和页数有上限,见工具页提示;每张图片输出一个与原图同名的文件,不会自动拼成一张大表。

问:要不要先登录才能试一张?
答:游客不开放识别,因为每一次识别都要向云服务商付费;注册后即可使用并拿到一次性赠送额度。

本站能力与限额说明

站内 表格识别转Excel,把有框线或没框线的印刷表格图片交给它,还原行列位置与跨行跨列的合并单元格;识别在服务器端完成,成品请当天下载。

它不保留样式、边框、底色、字体、列宽,也不给可计算公式和字段抽取。额度口径:每一次识别都要向云服务商付费,所以游客不开放识别,注册后即可使用;一页扣几点按能力不同(通用文字与手写文字 1 点、表格 2 点、手写表格 3 点);每日识别量有上限。具体点数余额与每日上限以 会员页 为准。

单文件上限 8MB;文件处理完保留 24 小时,到期自动清理。识别按额度点数计、不按次数计,别把转换类的每日次数口径理解成页数限制。VIP 会员单文件上限随档位提高到 20~50MB。