先用鼠标拖一下页面里最长的那行字。能选中就走转换档,选不中才用识别。选不中的 PDF 里面没有字符数据,任何按文字处理的转换都拿不到内容,只能先把每页当图片读一遍。
一、三种现象分别对应什么
同一份文件在阅读器里表现不同,原因也不同。对着下表挑自己那一种。
| 现象 | 文件里实际有什么 | 该走的通道 | 扣点情况 |
|---|---|---|---|
| 一行字都能选中 | 真实文字层 | 转换档 | 不消耗识别额度 |
| 一个字都选不中 | 整页是图片 | 识别类入口 | 按页扣点 |
| 能选中但顺序错乱 | 文字层错位或缺字 | 先试转换,不满意再走识别 | 走识别时按页扣点 |
二、为什么转换完打开还是一张图
转换类工具只做一件事:把已有的文字层搬进新格式,它不会去认图上的笔画。于是生成的 DOCX(2007 及以上的 Word 文档格式)打开后是一段段嵌在页面里的图片,字仍然选不中。
结论要说死:能转换文字,不能凭空造出文字。想让扫描出来的东西变成可编辑文本,必须经过识别这一步。OCR(Optical Character Recognition,光学字符识别)就是把每页渲染成图片再读字的过程,代价是按页扣点。
三、走识别的操作顺序
- 先在原 PDF 里试着选中一行字,确认确实选不中,避免白扣点。
- 打开「扫描件PDF转Word」,这个入口只收 PDF,单次数量和页数有上限,见工具页提示。
- 提交后逐页比对,重点看页眉页脚、表格里的数字和跨页段落。
- 成品当天下载,不必守着页面等。
四、分场景怎么选
- 只有几页要取字:走识别,比整份跑转换再手工敲字快。
- 整本几十页且只需要检索文字:先试转换,文字层哪怕顺序乱也能搜到关键词。
- 需要保留版面交给别人排版:走识别出 DOCX,再人工调一次版式,因为版面本来就不会还原。
- 里面有手写批注:改走「手写笔记转Word」,它是六个识别入口里唯一图片和 PDF 都收、还能混在同一次上传里的。
五、这几件事别做
- 不要拿转换档去啃扫描件,出不来字还浪费一次机会。
- 不要指望识别还原版面。识别只输出文字与换行,不能还原分栏、表格线、图片位置、页眉页脚和字体样式。要表格结构请走「表格识别转Excel」。
- 不要跳过校对。金额、编号、日期这三类必须逐个核对,识别不承诺准确率百分比。
常见问题
问:手机上能判断字选不中选不中吗?
答:长按页面出现选择手柄就是能选中;拖不出高亮框就是选不中,直接走识别即可。
问:一份 30 页的扫描件要多久、扣多少?
答:按页扣通用文字点数,页与页之间互相独立,其中某页报错或无法解码时那一页不扣点,其余页照常出。
问:识别完的字能直接交出去吗?
答:不能。空白页照样扣点但不会出现在输出里,交付前至少核一遍页数与关键数字。
本站能力与限额说明
站内 扫描件PDF转Word,选中不了字的那一类 PDF 从这里上传,服务器端逐页识别后输出 DOCX。成品当天下载。
识别只解决「把图上的字读出来」这一件事:能读出文字与换行,不能还原分栏、表格线、图片位置和字体样式。每一次识别都要向云服务商付费,所以游客不开放识别,注册后即可使用;一页扣几点按能力不同(通用文字与手写文字 1 点、表格 2 点、手写表格 3 点),每日识别量有上限,价格一律以 会员页 为准。
单文件上限 8MB,VIP 会员随档位提高到 20~50MB;文件处理完保留 24 小时到期自动清理,已下载过的会更快清理。识别按额度点数计、不按次数计,不要把转换类的次数限制套到这里。涉密材料请先自行评估是否上传。若那份 PDF 其实能选中字,改走 PDF转Word。