一份扫描出来的 PDF 想改成 Word。这一步和你平时做的 PDF 转 Word 不是同一个动作:文件里没有文字,只有图,所以必须先把每页变成图片认一遍字,再把认出来的字写进文档。理解这条链,才不会对结果产生错误的期待。
上传前先做一件事:确认它真是扫描件
在 PDF 阅读器里用鼠标选一段文字。能选中、能复制的是文字型 PDF,直接用 PDF转Word —— 效果更好,而且不消耗识别页数。选不中、整页其实是一张大图的,才是扫描件,需要走识别。
这一步判断错了,代价是双重的:既花了识别页数,又拿到了一个本来能更好解决的结果。10 秒的判断方法见 10 秒判断 PDF 是图片型还是文字型:判错的代价是多花一倍时间。
流程和三条扣页规则
入口是 扫描件PDF转Word,上传 PDF 后点开始识别,下载 .docx,Word、WPS 都能打开编辑。
三条规则要提前知道:
一、按实际页数扣点。 每页按 150 DPI 渲染成一张图片并调用一次识别,10 页的文件就是 10 页;扫描件识别属于通用文字能力,每页扣 1 点,10 页消耗 10 点。
二、空白页也扣 1 页。 因为识别之前无法知道它是不是空白。但空白页不会写进输出文档。
三、供应商调用失败的那一页会退回。 报错、限流、接口故障时,那一页扣掉的点数原路退回。但反过来:整份都识别不到文字时虽然会报错,已经调用成功的页仍按成功计费、不退 —— 空白件或清晰度不够都属于这一类。
每月额度按身份给:注册一次性送 5 点、永久有效,VIP 会员每月另有 20~120 点配额(当月不结转)。单次上限是另一条独立规则:10 页,注册与会员相同(识别不向游客开放) —— 这是同步处理的实际上限,页数再多会超时。
最重要的一段:输出和原扫描件长得不一样
这一点必须写在最前面:输出只保证文字可复制、可编辑。 每页正文按识别到的行顺序排列,页与页之间有分页符,但分栏、表格线、图片位置、页眉页脚、原来的字体样式都不会保留。
也就是说,转出来的 Word 是一份内容正确的纯文本稿,不是一份版面对齐的复刻件。需要保持原版面提交的材料,请直接用原 PDF,不要指望识别来还原。想同时保留影像与文字的折中方案,见 双层 PDF 是什么:既保留原版面又能搜索文字的做法。
三个会明显掉效果的情况
表格。 扫描件里的表格识别后会散成一串上下排列的文字,行列全丢。表格页请单独走 表格识别转Excel。
盖章与严重歪斜。 被红章压住的那几行、倾斜度过大的页面,准确率明显下降,这属于能力边界。
分辨率过低的原件。 150 DPI 已经够用,但如果源文件本身就是低分辨率的小图拼出来的 PDF,识别前信息就已经丢了。这类扫描件转出的效果取决于原图,不取决于这一步。
加密、大小与隐私
设置了打开密码的 PDF 需要先解密再上传。单文件大小限制:免费 8MB,VIP 月卡 20MB、半年卡 30MB、年卡/银卡/金卡 50MB。
隐私方面说清楚两件事:逐页图片会加密发送给阿里云读光或百度智能云的识别接口,这是识别能发生的必要条件;本站侧的 PDF 与逐页图片存放在隔离的临时目录,识别完成后逐页图片立即删除,原 PDF 默认 24 小时后自动清理。涉密或内部资料请先按自己的标准判断,见 在线转换 PDF 时,你的文件到底去了哪里、留多久、谁能看到。