一份保单通常有三类完全不同的页面:责任与保费表、现金价值表、条款正文。把它们当成同一件事处理,会出现「数字加不起来」和「小字全糊」两种典型结果。

先确认你需不需要识别

电子保单多半是可复制文字的 PDF。能选中文字就别识别:直接用 PDF 转文本 取字,它取出的是文件里已有的字符,不经过图像识别,也就不会有形近字错认。识别只用于扫描件和拍照件。怎么十秒判断,看 10 秒判断 PDF 是图片型还是文字型:判错的代价是多花一倍时间。

现金价值表的数字为什么加不起来

保费、保额、现金价值这几张表是密集数字矩阵,只能用表格识别转Excel,图片转文字会把整行数字拼成一串。

导出后要留意一个细节:保险表格习惯写成带千分位逗号的形式。识别不会替你去掉这个逗号,而 Excel 里带逗号的字符串如果不是标准数值格式,就会被当作文本存着 —— 表现为选中一整列,状态栏只有「计数」没有「求和」。补救是在列上做一次「查找替换」把逗号删掉,或用分列功能重置格式。本站对纯数字(含小数与负号)会按数值写入,前导零的编号和超过 15 位的长号码则故意按文本保存,规则见 图片转 Excel 后数字不能求和?按文本写入是故意的。

条款正文:识别的目的只有检索

条款是典型的小字密排页。图片长边不足 1000 像素会明显漏识,手机拍整页条款常常正好卡在这条线以下,建议拍完先导出看字的边缘再决定重拍。

条款转出来主要为了全文搜索(找等待期、健康告知、免责条目),不需要还原排版,图片转文字 逐行输出即可。但天数、岁数、金额这类关键数字必须回原件核对,识别不做任何合理性判断;本站也只提供文字提取,不解读条款含义,保障责任以保险合同和保险公司核定为准。

表格里最容易错的四类字符

形近字母与数字(零与 O、壹与捌)、日期里的年月日顺序、中文数字大写金额、以及百分比符号。逐条对照方法见 识别结果里 0 和 O、1 和 l 分不清?形近字符错的成因与核对清单。

归档与转发

保单含投保人身份证号、手机号、银行卡号。转发给他人前用证件号脱敏过一遍。要合并成一份提交,图片转PDF 比重新打印更省事,打印时哪些页该出纸见 电子保单打印:保单页、条款和免赔额分别要打印哪些。