文件转换与处理的实用图文教程,每篇解决一个真实问题
身份证、病历、发票多张手机照片先用图片转PDF逐份成页,再合并成一个文件上传;免费单文件上限8MB,超了才用压缩。影像件要的是看得清,不是字能选中。
十几页的体检报告用扫描件PDF转Word处理,单次最多10页,必须分两批上传;结论页与影像页分开做,检验科指标每一格都得回原图核对,识别只解决打字慢。
系统无法在识别前预知某一页是否空白,所以 PDF 的空白页同样按 1 页计、扣 1 点,只是不写进输出文档。哪些页该删、怎么删,比事后争论退点更省时间。
回单截图与流水表格识别成Excel后,余额列要用前一页期末自算比对,日期列看是否跳序,借贷方向单独回原图核对。
图片转文字、手写识别、表格转 Excel 等六个工具扣的是同一份点数,所以真正的省法不是找便宜入口,而是把贵的倍率只花在便宜工具做不到的事上。
考勤符号不在词频里,同一个勾可能变成对号、人字或空格。做法是先立符号对照表,再用查找替换统一成一个字后点数。
表格内容默认按文本写入是有前导零或超长编号的保护机制,真正需要转数值的是纯金额列,账号工号转了会永久丢位。
厂商给的百分比是字符级、在干净标准样本上的数字。本文算清字符准确率和「整页能不能直接交」的差距,并给出一套十页抽样自测与三类错误的记录方法。
准确率低很少是工具的问题,绝大多数出在输入质量上。本文按影响大小排列分辨率、字号、倾斜、对比度、压缩和内容类型六个因素,并给出可执行的补救动作。
识别额度是账号级共用的,注册赠送 5 点、会员每月配额和页数包余额都由这个账号下的所有使用者共同消耗。本文说明共用的真实后果,以及团队按人分账的两种做法。
本站真正做到三不的是TXT处理、CSV转换、JSON格式化、XML转换和DXF查看器,全程在浏览器本地跑。识别和格式转换都不在此列,需要登录或上传,别混淆。
表格识别依赖表格线重建行列,无边框的松散排版错行错列概率很高。本文解释为什么没有线就分不准,给出补画格子、按列拆图两种补救,以及改用文本再分列的判断标准。