扫描件 PDF 默认不能搜索,原因是它的每一页都是一张图片,里面没有可供程序读取的文字层。要让 Ctrl+F 能命中关键词,必须先做一遍识别,把文字写进去;只做压缩、拆分、合并这些操作,永远不会让它变得可搜。
一、先判断自己有没有层
- 用鼠标划选一段正文:能选中单个字说明有文字层,选不中就是纯图片。
- 试着复制一句话到记事本:粘出来是乱码或空的,同样是图片型。
- 看来源:扫描仪与手机拍照多为图片型,办公软件导出多为文字型。
| 情况 | 能否搜索 | 该怎么办 |
|---|---|---|
| 可选中且能复制 | 能 | 什么都不用做 |
| 整块框成一张图 | 不能 | 先识别再存档 |
| 部分页能选 | 一半能 | 只对图片页处理 |
二、要能搜,站内走哪条
- 手上有 PDF 的,直接走 扫描件PDF转Word,产出可编辑文本,通用每页扣 1 点。
- 只有照片或截图的,先用 图片转文字 取出纯文本,再和原图并排存档。
- 只要一个能搜的文本副本、不要求版面的,走 PDF转文本 更省,但图片页取不出内容。
三、给一批旧档案做检索怎么做
- 先分堆:完全没层的挑出来,这部分才需要花识别额度。
- 混合件按页拆,只处理图片页,能省掉一大半点数。
- 分批做,单次页数有上限见工具页提示;每日识别量也有上限,超出次日再试。
- 做完用两三个只可能出现在正文里的词回搜,比如人名或单号;命中不了说明那几页仍是图片型,对着扣点记录把这几页单独重跑一遍。
四、别做这几件事
- 别指望压缩能加层:它只会让图片更糊。
- 别把加密件直接扔进识别:带打开密码的先解密。
- 别跳过校对:数字、姓名、单位这类易混字符必须逐处核。
五、存档建议留两份
一份原始影像负责凭证,一份识别文本负责检索,两边同名存放。日后引用写「原件第几页」时不会因为副本重排而找不到出处。
常见问题
问:识别后原版面还在吗?
答:产出的是可编辑文档,版面会重排;要看原版面请保留扫描图那份。
问:手机上能做吗?
答:能,浏览器上传即可,只是核对识别结果在小屏上更容易漏。
问:表格里的数字也能搜到吗?
答:能,但要走表格那条,每页扣 2 点,手写表格每页 3 点。
本站能力与限额说明
站内 扫描件PDF转Word 收 PDF 与图片,按页扣减识别额度(通用 1 点、手写 1 点、表格 2 点、手写表格 3 点);转换在服务器端完成,服务器装有可匹配的中文字体,特殊字体可能回退,涉密材料请自行评估是否上传。
识别不承诺具体准确率,也不负责还原跨页表格与多栏排版;其余 OCR 入口不收 PDF,只有本篇这一条和手写笔记转 Word 收。加密文件要先解密才能处理。
游客与未充值注册用户单文件上限 8MB、每天 5 次成功转换;充值 VIP 会员后单文件上限提高到 20~50MB(随档位递增),转换次数不限,各档当前售价与额度以 会员页 为准。文件处理完保留 24 小时,到期自动清理,成品请当天下载。