印章那块本来就不在识别范围内。印章、数学公式、竖排古文与涂改覆盖的内容无法可靠识别,红色公章压住的文字还会连带掉字;这个入口能给你正文文字,不能给你章、二维码和图形位置。

一、输入口径先对齐

你手上的东西站内怎么走注意
扫描版 PDF「扫描件PDF转Word」只收 PDF,每份输出一个 DOCX
单张证书照片图片类识别入口收 JPG、JPEG、PNG、BMP、WEBP
带文字层的 PDF转换档能选中一行字就别耗识别额度
TIFF 或 GIF 扫描件不收站内也没有它们的转换入口
加密 PDF不能直接处理要先解密去密码

扫描件 PDF 每页按固定分辨率渲染成一张图再识别,这个精度是既定的,原件扫得再清楚也不会额外提升这一档。

二、为什么会缺一大块

  • 印章不识别,章内的单位名称与编号同样出不来。
  • 图片位置不还原,证件照、防伪纹、二维码都会被跳过。
  • 分栏、表格线、页眉页脚与字体样式一律不还原,只输出文字与换行。
  • 不做字段抽取,不会自动拆成姓名、证件编号、有效期这些字段,要自己在文档里归位。

三、操作步骤

  1. 先在 PDF 里试选中文字:选得中说明是文字型 PDF,走转换档效果更好且不消耗识别额度。
  2. 确认未加密;加密件要先解密去密码。
  3. 整页歪斜的先转正再传:文字类入口只尝试纠正整页 90 度或 180 度,歪斜与局部旋转不在纠正范围内。
  4. 拿到 DOCX 后逐项比对原件,重点核号码、日期与金额,手写签署内容一律人工校对后再用。

四、电子化时怎么保住章

结论很直接:要留印章只能保留原件或另存整页图片。常见做法是把识别出的 DOCX 当可检索文本层,原始 PDF 或整页图片作凭证附件并存;两者对不上时以原件为准。涉及对外提交材料,是否认可电子副本以当地主管部门要求为准。

常见问题

问:能不能把印章抠出来插到文档里?
答:不能,站内不提供修图、去水印或图形提取,识别也不输出图片元素。

问:多页证书会合成一份吗?
答:每份 PDF 输出一个文件;若拆成多张图片上传,则每张一个同名文件,不会自动拼接。

问:识别完的文字能翻译成英文吗?
答:不做翻译,中英文混排按原样输出。

本站能力与限额说明

站内 扫描件PDF转Word,只收 PDF,逐页渲染后识别并输出 DOCX(2007 及以上);证书是单张照片时改走 图片转文字。每一次识别都要向云服务商付费,所以游客不开放识别,注册后即可使用;扣点按能力不同,通用与手写 1 点、表格 2 点、手写表格 3 点,每日识别量有上限。

识别能出文字,不能出印章、公式、竖排古文与被涂改覆盖的内容,也不还原版面与样式;两家云端服务都不承诺准确率百分比。

注册用户有一次性赠送额度且永久有效,VIP 每月另有配额,各档当前售价与额度以 会员页 为准。识别按额度点数计、不按次数计,单文件上限 8MB,文件处理完保留 24 小时、到期自动清理,成品请当天下载。