选不中就是这份文件里没有文字层,页面上那些字其实是一张图。这种文件用转换档取不出内容,只能走识别;能选中还用不着识别,别白扣额度。
一、先用一个动作判断走哪条路
- 能出现选区、能复制出文字:这是文字型文件,直接走 PDF转Word。
- 拖不动、整页像照片那样被框住:没有文字层,必须走 扫描件PDF转Word。
- 连内容都打不开:多半加了密码,先去密码再处理。
能选中说明字真的在文件里,选不中说明那只是一张图;屏幕上看得见,不代表程序读得到。
二、为什么转换档什么都没转出来
转换档是把文件里已有的文字对象搬进新文档,没有文字层时可搬的东西是零,成品就是一份几乎空白的 Word,页面那张图不会跟着搬过去。识别档反过来,先把每页渲染成图再从图上认字,所以能吃扫描件,代价是每页单独计一次额度。
三、要走识别,按这个顺序做
- 确认没加密,这一档只收 PDF;单次页数有上限,量大先拆分分批传。
- 每份 PDF 输出一个同名文档,下载后核对人名、编号、金额这三类内容。
四、哪些内容就算走了识别也认不出来
| 页面上的东西 | 识别后的结果 | 建议做法 |
|---|---|---|
| 正文印刷体汉字 | 只剩文字与换行 | 直接识别即可 |
| 分栏、表格线 | 只剩上下顺序 | 要紧的表改走表格档 |
| 印章、手写签名、竖排古文、公式 | 不可靠,通常取不到 | 手工补录或留原图对照 |
| 空白页 | 照扣点但不写进文档 | 上传前先删空页 |
五、这几件事别做
- 别同一份文件又转换又识别:先定性质,只做一条路。
- 别把识别结果当成可搜索原件:转完自己搜一个词验一遍。
- 别用截屏代替原件:截屏压掉小字,等于自己先降一档精度。
- 别指望它认印章和公式:这类内容取不出来,只能手工补录。
常见问题
问:只有一页是扫描的,其余都能选中,怎么办?
答:把那页单独拆出来识别,其余用转换档处理,最后并起来,只为真正需要的页面付额度。
问:手机上能做吗?
答:能,浏览器里上传、等待、下载全程走得完,前提是这份文件已在手机里。
问:识别出来的文字能保持原来的字体和缩进吗?
答:不能,输出只有文字与换行,想要原版面请连同原文件一起留存。
本站能力与限额说明
站内 扫描件PDF转Word,把没有文字层的 PDF 逐页送服务器识别,输出一份与原文件同名的 DOCX。转换在服务器端完成,服务器装有可匹配的中文字体,特殊字体可能回退,涉密材料请自行评估是否上传。
它只收 PDF,不收图片,不接受加密件;不还原分栏与表格线,不做翻译与字段抽取,也不承诺识别率。每次识别都要向云服务商付费,游客不开放识别,注册后即可使用;注册时赠送的识别额度永久有效,VIP 每月另有配额,通用文字每页扣 1 点;每日识别量有上限,超出次日再试或联系站长,售价以 会员页 为准。
单文件上限 8MB,VIP 提高到 20~50MB;识别按点数计、不按次数计。文件保留 24 小时后自动清理,成品当天下载。