文件转换与处理的实用图文教程,每篇解决一个真实问题
识别输出只保证按它认到的行顺序给出文字与换行,不做分栏还原。想保住阅读顺序,就把每一栏单独裁开分别识别再拼接,一次提交多张时结果按上传顺序排。
不用你自己转:WEBP 可以直接上传,但送识别前会先重编码成 JPEG。多这一道有损编码,小字和浅字会再降一档,要紧的图存成 PNG 或 JPG 再传更稳。
描边颜色映射成颜色号、虚线的间隔数组落成命名线型,映射不上就统一画成连续线;靠名称表达的语义必然丢失,交付前先用查看器逐项复核丢了哪几项。
从 PDF 和网页复制会带进不换行空格、软连字符与零宽字符,肉眼看不见却占位。先把它们显示出来定位,再按类别一次批量删除,比凭手感敲空格可靠得多。
走转格式加合并三步:Word、PPT 各自先转成 PDF,在合并列表里拖好顺序合成一本,最后统一加页码或水印。不要在办公软件里复制粘贴合本,那样页边距、页眉和编号会全乱。
核对系统导出的 XML 单据,先把属性值和元素文字这两个位置分开看:同一名称的字段可能挂在开始标签的属性里,也可能夹在首尾标签中间,只抓后者就会整列丢空。先在格式化视图确认结构,再决定留 XML 还是出表。
这不是打不开。XML 装的是数据不是版式,浏览器只按标签结构折叠展示。给人看就把字段抽成表格再导出,给系统用就保持 XML 原样并先做结构与编码校验,别顺手改标签名。
XML转换能列出「元素路径 → 属性名 = 值」的完整对应关系并导出 CSV 或 JSON。做配置清点、字段台账时,这条路比通读整份文档快得多,但命名空间前缀需要人工归一。
文字交给识别,公式与插图必须留原图;按页拍、公式密集页先挑出来单存,转完走「原图加识别文字」双轨整理,别指望识别把式子变成可编辑内容。
接龙数据清洗的顺序是先全角转半角并去掉空行,再按学号列去重,最后核对总行数与应交人数。顺序反了会让本该相同的两条记录因不可见字符被判成不同,重复项漏删。
按图号排序后用 PDF 合并成一份,整体加上「第 X 页共 Y 页」再交;原始点集与表格数据不塞正文,另打一个 ZIP 随附交付。
先判断出问题那份是文字型 PDF 还是扫描件:前者能转回 Word 直接改字,后者改了也不生效;改动量小的那一份优先改,并同步全部关联单据。