文件转换与处理的实用图文教程,每篇解决一个真实问题
菜单是两列表格可以导成 Excel,招牌和说明牌多为艺术字与竖排文字,属识别的不可靠范围。本文按三类物料分别给出判断和替代做法。
会议纪要的骨架是时间地点与会人议题讨论要点决议待办,决议与待办分开写,待办必须落到责任人和期限
会议纪要混合了正文、表格签到表和决议条款,转换后三类内容损失不同。本文按纪要结构拆解转换后的修复顺序,并给出定稿分发的格式规范。
体检报告常见三种形态:医院自助机打印件、APP 里的长图、邮箱收到的多页 PDF。要打成清楚的 A4 提交件,关键是别用缩放硬塞,而是按页拆分、逐页转图或转文档后再排到 A4 上。
化验单是四列密排表格,用图片转文字必然串行。本文按页面区块给出取字方案,并说明单位连写、上下箭头和医生手写批注各自的正确处理方式。
医生手写体是中文 OCR 公认最难的一类,通用手写识别也无法可靠处理。本文说明它为什么难,影像科与病历影像的实际通行做法,以及患者侧真正可行的替代方案。
Markdown 只存文字与层级,不存字号、页边距和表格列宽,所以转 Word 必然丢版式。正确做法是结构留在源文,版式在 Word 端一次定死,交付前逐项核对
Mac 自带的预览和 Pages 都不能直接把 PDF 存成 docx。本文说明 Mac 上真正可行的三条路径、各自的格式损失程度,以及苹果生态下最容易踩的两个坑。
有损靠丢信息换体积,无损靠更聪明的编码不丢信息。讲清两者的原理、适用格式,以及为什么 JPG 越压越糊、PNG 却不会。
聊天记录长图、密集参数表、缩略整页这三类内容识别不全,成因都是单行文字高度低于可靠范围。本文给出多少像素才够用、怎么重新取图,以及拆分识别的做法。
同一张 logo 图,交付印刷、刻字和网页用的格式完全不同。本文按用途给出输出格式、参数和分色处理的做法,以及文字为什么会变成空心框。
选本地还是服务器,只看体积、格式、能力三个约束。四个文档工具和DXF查看器在浏览器本地跑,识别与格式转换必须上传,别凭感觉挑入口。