印章那块本来就不在识别范围内。印章、数学公式、竖排古文与涂改覆盖的内容无法可靠识别,红色公章压住的文字还会连带掉字;这个入口能给你正文文字,不能给你章、二维码和图形位置。
一、输入口径先对齐
| 你手上的东西 | 站内怎么走 | 注意 |
|---|---|---|
| 扫描版 PDF | 「扫描件PDF转Word」 | 只收 PDF,每份输出一个 DOCX |
| 单张证书照片 | 图片类识别入口 | 收 JPG、JPEG、PNG、BMP、WEBP |
| 带文字层的 PDF | 转换档 | 能选中一行字就别耗识别额度 |
| TIFF 或 GIF 扫描件 | 不收 | 站内也没有它们的转换入口 |
| 加密 PDF | 不能直接处理 | 要先解密去密码 |
扫描件 PDF 每页按固定分辨率渲染成一张图再识别,这个精度是既定的,原件扫得再清楚也不会额外提升这一档。
二、为什么会缺一大块
- 印章不识别,章内的单位名称与编号同样出不来。
- 图片位置不还原,证件照、防伪纹、二维码都会被跳过。
- 分栏、表格线、页眉页脚与字体样式一律不还原,只输出文字与换行。
- 不做字段抽取,不会自动拆成姓名、证件编号、有效期这些字段,要自己在文档里归位。
三、操作步骤
- 先在 PDF 里试选中文字:选得中说明是文字型 PDF,走转换档效果更好且不消耗识别额度。
- 确认未加密;加密件要先解密去密码。
- 整页歪斜的先转正再传:文字类入口只尝试纠正整页 90 度或 180 度,歪斜与局部旋转不在纠正范围内。
- 拿到 DOCX 后逐项比对原件,重点核号码、日期与金额,手写签署内容一律人工校对后再用。
四、电子化时怎么保住章
结论很直接:要留印章只能保留原件或另存整页图片。常见做法是把识别出的 DOCX 当可检索文本层,原始 PDF 或整页图片作凭证附件并存;两者对不上时以原件为准。涉及对外提交材料,是否认可电子副本以当地主管部门要求为准。
常见问题
问:能不能把印章抠出来插到文档里?
答:不能,站内不提供修图、去水印或图形提取,识别也不输出图片元素。
问:多页证书会合成一份吗?
答:每份 PDF 输出一个文件;若拆成多张图片上传,则每张一个同名文件,不会自动拼接。
问:识别完的文字能翻译成英文吗?
答:不做翻译,中英文混排按原样输出。
本站能力与限额说明
站内 扫描件PDF转Word,只收 PDF,逐页渲染后识别并输出 DOCX(2007 及以上);证书是单张照片时改走 图片转文字。每一次识别都要向云服务商付费,所以游客不开放识别,注册后即可使用;扣点按能力不同,通用与手写 1 点、表格 2 点、手写表格 3 点,每日识别量有上限。
识别能出文字,不能出印章、公式、竖排古文与被涂改覆盖的内容,也不还原版面与样式;两家云端服务都不承诺准确率百分比。
注册用户有一次性赠送额度且永久有效,VIP 每月另有配额,各档当前售价与额度以 会员页 为准。识别按额度点数计、不按次数计,单文件上限 8MB,文件处理完保留 24 小时、到期自动清理,成品请当天下载。