表格识别最危险的地方不是错,而是错了以后表看起来完全正常。一份 60 行的表错 3 个数字,肉眼扫过去什么也发现不了。验收必须靠结构化的检查顺序,不能靠「看着差不多」。

第一步:数行数和列数

打开文件先看总行数和总列数,与原图对照。 这两项任意一项不对,后面的核对都无意义:

  • 列少了 → 发生了合并错行,边界推断失败,这张图重拍或补表格线后重做
  • 行少了 → 有整行漏识,常见于该行字太小或被遮挡
  • 多了空行 → 一张图里识别出多个表格时会用空行分隔,合并前必须删掉,否则公式区域会被切断

第二步:用重算做交叉校验

这是效率最高的一步,能一次覆盖全表。 在旁边插一列,用识别出的两个因子去算第三个值:

  • 有单价和数量的,单价×数量 与原表金额比对,不一致的行就是可疑行
  • 有多段小计的,把小计重新求和与原表合计比对
  • 有起止日期的,用 日期计算器 核对天数列

不要抽查,要整列比对。 抽查命中率低,而公式比对是零成本的。

第三步:按列的性质分组核对

三类列的风险完全不同,投入要分开:

  • 编号列(文本):只要长度对不对。18 位身份证变 17 位、单号掉了一位,用 LEN() 一筛就出来。注意站内规则是有前导零或超过 15 位的内容一律按文本写入,这是保护不是缺陷。
  • 数字列(数值):核形近字。0/8、1/7、3/8、6/5、两串数字颠倒,是数字识别的高发错误 —— 展开见 识别结果里 0 和 O、1 和 l 分不清?形近字符错的成因与核对清单。
  • 中文列(文本):核专有名词。人名、地名、品名是错字重灾区,因为这些词不在通用词频里,模型更容易挑一个形近常用字。

第四步:单独看三类高危区域

合并单元格的边界(跨行标题被拆成两行是典型表现)、表格最后一行(容易被当成表外文字)、表格线外的备注(可能被并进最后一列)。

第五步:把不可信的部分标出来

核对完不等于全部正确,尤其是手写数字。 金额、数量、电话、身份证这五类,建议在表里加一列「已核对」并留签名人,出问题时能追溯到是哪一步没核。

如果原表里有手写内容,正确的做法是那一块改走 手写表格转Excel,而不是指望印刷体这一页 —— 两者的差别见 手写表格与印刷表格是两个入口:走错的三种表现。

一个底线判断

关键数据表不要以识别为唯一来源。 识别适合做「初稿 + 加速录入」,不适合做「唯一录入手段」。合同金额、工资、报税数据这类内容,应当由录入者按原图逐格敲一遍 —— 用识别省下的时间,最终都要花在核对上,而且省不掉。