拖放图片到这里
或
支持:JPG、PNG、BMP、WEBP(最大8MB,一次最多1张)
仅识别印刷体:手写内容请改用「手写文字识别」,印章、数学公式与竖排文字无法可靠识别。
识别额度与页数包
| 身份 | 识别额度(点) | 单次页数上限 | 说明 |
|---|---|---|---|
| 未登录游客 | 不开放 | — | 每次识别都要向云服务商付费,因此需注册后使用(短信验证码登录即完成注册),注册即送 5 点 |
| 注册用户 | 一次性 5 点 | 10 页 | 赠送点数永久有效不过期,用完可购买页数包 |
| VIP 月卡 | 每月 20 点 | 10 页 | 当月用不完不结转,次月 1 日自动恢复 |
| VIP 半年卡 | 每月 30 点 | 10 页 | 当月用不完不结转,次月 1 日自动恢复 |
| VIP 年卡 | 每月 45 点 | 10 页 | 当月用不完不结转,次月 1 日自动恢复 |
| VIP 银卡 | 每月 65 点 | 10 页 | 当月用不完不结转,次月 1 日自动恢复 |
| VIP 金卡 | 每月 120 点 | 10 页 | 当月用不完不结转,次月 1 日自动恢复 |
| 页数包 | 体验包 100 点 / ¥12.9 常用包 500 点 / ¥49.9 一次购买永久有效,额度用完后自动扣页数包 | ||
调用按「页」、扣减按「点」:一张图片 = 1 页,一份 PDF = 每页 1 次识别;每识别 1 页扣 1~3 点识别额度(表格识别转Excel 每页 2 点、手写表格转Excel 每页 3 点),没有点名的工具每页扣最低那档。供应商调用失败的那一页不扣点。 会员套餐已含每月识别额度(月卡 20 点、半年卡 30 点、年卡 45 点、银卡 65 点、金卡 120 点),识别时先扣当月配额,配额用完再扣页数包余额;注册赠送的 5 点与购买的页数包同在一个余额里,永久有效。 查看页数包 →
关于在线 OCR 文字识别
OCR 是什么,为什么有的 PDF 能直接复制文字有的不能? OCR(Optical Character Recognition,光学字符识别)是把图片里的文字形状还原成字符编码的过程。Word 导出的 PDF 内部本来就存着字符,选中即可复制,不需要 OCR;扫描仪、手机拍照生成的 PDF 每一页其实是一张图片,选中只会框出一整块,这种才需要 OCR。判断方法很简单:在 PDF 里试着拖动选中一行字,能选中的是文字型,选不中的是扫描型。文字型 PDF 请直接使用 PDF转Word,速度快且不消耗识别额度。
扫描件转出来的 Word 和原文件长得一样吗? 不一样,这一点必须先说清楚。本工具只保证识别出的文字可以复制、可以编辑、可以检索,不还原原版面:分栏会拉平成单栏,表格线与单元格会消失,图片与图表不会出现在结果里,页眉页脚按识别到的顺序混在正文中,字体字号统一为一种正文样式。需要保留原版面的场景(合同归档、证件留档)请继续使用原 PDF,不要指望转换结果能当副本用。
识别准确率取决于什么? 取决于三件事:一是清晰度,长边不足 1000 像素、模糊、有阴影或反光的图片漏字明显增多;二是排版,印刷体横排正文最稳,手写内容请改用下面的手写识别(用印刷体模型认手写稿基本认不出来),印章、数学公式、竖排古文与艺术字无法可靠识别;三是语言混排,中英混排通常没问题,但小字号的密集表格容易串列。识别前先确认原图能看清,比事后校对省时间。
表格识别和普通文字识别有什么区别? 普通文字识别只输出文字与换行,不关心位置关系;表格识别会分析横竖线的走向,还原行、列与跨行跨列的合并单元格,因此适合发票、报表、名单这类有线框的表格。它不还原边框样式、底色、字体与列宽,输出的也不是可计算的公式,单元格内容是识别到的文字。无线框的松散排版可能被拆错行列,这种情况用普通文字识别再自己整理反而更可控。
手写识别能认到什么程度? 手写与印刷体调的是供应商不同的产品,手写模型针对笔画连写与字形不规整做了训练,两者不能混用:手写笔记、会议记录、课堂笔记、手写台账请选带"手写"字样的那一栏。实际效果高度依赖字迹 —— 工整、笔画清晰、单行文字高度在 10~50 像素之间的手写中文通常可用;连笔速记、草书、字迹过密或用力过淡时准确率明显下降,可能整段识别不出来,也可能识别成形近别字。厂商公开的都是工整手写的整体指标,连笔与草书没有公开数据,因此手写识别结果一律要人工校对,姓名、金额、编号、日期这类关键内容尤其要逐个核对。手写笔记的照片与扫描 PDF 都能转 Word,但只保证文字可编辑,不还原笔迹与版面。
为什么手写识别没有备用供应商? 手写表格识别目前只有阿里云读光提供,百度智能云没有对应的产品,因此这一栏无法像图片转文字那样在主供应商故障时自动切到备用家;阿里侧欠费、限流或临时故障时,手写表格会直接返回失败提示,稍后重试即可。手写的纯文字反过来只走百度智能云一家:阿里云读光同样能认手写,但每页报价是百度智能云的 23 倍,拿它当备用等于每页白多花这么多钱,因此这一档也不设备用家。百度侧临时不可用时,手写文字识别与手写笔记转 Word 同样直接返回失败。有备用家的只有图片转文字、扫描件 PDF 转 Word 与表格识别这三栏,它们在主供应商故障时会自动切到另一家继续识别,用户看不出区别。供应商报错、图片无法解码的那一页不扣点;同一次上传里已经识别成功的页是真花了钱的,不会退点,所以上传前请先确认图片清晰。
为什么按点数扣减,页数包又是怎么算的? OCR 与本站其它工具不同:其它工具只用本站服务器的算力,识别则每识别一页都要向云服务商付费,因此按「页」调用、按「点」扣减,也因此不像其它工具那样对游客开放。一张图片 = 1 页,一份 PDF = 每页 1 次识别;每页扣几点由工具决定,表格识别转Excel 每页 2 点,手写表格转Excel 每页 3 点,其余工具每页 1 点 —— 表格与手写表格调用的是供应商单独计费的产品,每页成本明显高于普通文字识别,所以扣得多,一份额度六个工具通用。注册即送 5 点(短信验证码登录即完成注册,赠送点数永久有效不过期);开通会员后每月另有配额,月卡 20 点、半年卡 30 点、年卡 45 点、银卡 65 点、金卡 120 点,当月用不完不结转,次月 1 日自动恢复。识别时先扣当月配额,配额用完后从页数包余额里扣,页数包一次购买永久有效不过期。供应商报错、图片无法解析的那一页不扣点;扫描件里的空白页照样扣点,因为识别之前无法预知这一页有没有字、供应商也确实对这一页向我们计了费,只是空白页不会写进输出文档。整份 PDF 一个字都识别不出来时会直接报错,已扣的点不退回,所以上传前请先确认扫描件的文字肉眼能看清。
一次能识别多少页? 单次最多 10 页。识别是同步进行的:PDF 要逐页渲染成图片,再逐页调用识别接口,页数太多会超出请求时限。几十页的扫描件请先用 PDF拆分 按页码切成几份再分别识别。
图片会被发到哪里?文件保存多久? 识别在云端完成,图片会以加密连接发送给阿里云读光或百度智能云的 OCR 接口,两家都是国内持证云服务商;本站不保留识别结果的长期副本,上传的原件与结果文件默认 12 小时后自动删除,下载链接为限时签名地址(120 分钟内有效)。涉及个人隐私或商业机密的内容,请先自行遮盖关键信息再识别,详见 隐私政策。