文件转换与处理的实用图文教程,每篇解决一个真实问题
表格识别会把票面抬头一并读成表头,导完先删空行、把表头重建成一行,再逐格核对价税合计、税额和纳税人识别号;税额那一列用金额乘税率反查,对不上就是两列串行。
纸张方向只作用于节,本文给出选中内容自动分节与手动分节两种做法,并说明横版页页眉、装订边和导出 PDF 后的缩放问题
三件凭证共用一个主键命名:有报销单号就用单号打头,没有就退回「日期加金额」这类带强区分度的写法,后缀固定用发票、行程单、支付凭证三个词且长期不改。缺件时留空位或建同名占位,编号不许顶替。
三条判据定格式:有透明只能 PNG,JPG 会把它填成白底;还要再编辑就留在 PNG,只读或打印才转 JPG 控体积;交付前先问接收方能不能解码 WEBP。同一条流水线上处理件与交付件各存一种。
转出来的坐标只有像素没有真实比例,不能直接拿去加工。先在图里挑一条已标出的中心距或标准孔径做参照整体缩放,再用两处不同方向的独立尺寸复核,轮廓首尾闭合才能交给外协。
给人读或提交校验就只做缩进,层级一字不动;要统计和交付才摊平成行。动手前先写死「哪一层当一个记录」,规则不固定,同一份数据每次导出的行数都会不同。
需要属性、命名空间或结构校验就留 XML,只传层级数据用 JSON。判据是对方接口文档要求什么,不是你偏好哪种写法,两者互转必丢信息。
邮件合并=主文档 + 数据源 + 域占位符。三步能把一份 Excel 名单变成上百份内容各异的通知书,直接打印或批量导出成一个个单独文件,不用再手工改名字。
格式化只是第一步。真正能定位问题的是三件事:展开缩进看清层级、把超长数组折叠、再查同名重复键。肉眼看平铺长串永远找不出被覆盖的那个字段。
两栏排版的化验单整页识别会串列,先沿中缝裁成左右两块各识一次,再用参考区间那一列校验行列是否错位,最后逐格比对原始单据。
先自查三处:字迹边界是否发虚、纸张边缘有没有裁到、有无阴影压住金额栏。多数所谓「影像不清」的不符点出在这三点,而不是分辨率不够高。
别整页缩印,A3 对折缩到 A4 会把字号直接砍一半。按栏位拆成两页 A4 分别输出,每张保持原字号,再在页脚补第X页/共Y页,装订顺序才不会乱。