图片里的字复制不出来,是每天都要遇到的小事:一张报价截图、一页扫描的合同、别人拍来发给你的纸。图片转文字就是把图里的字符提取成能选中的纯文本。动手前必须先知道它能做到哪一步,否则会对着结果反复返工。
先确认你要的是哪一种识别
三条路产物完全不同,选错拿不到想要的东西:
- 只要文字、不关心原来排版:用 图片转文字,输出 TXT
- 原文件是每页一张图的 PDF、要在 Word 里改:用 扫描件PDF转Word
- 图里有表格线、要还原行列:用 表格识别转Excel
判断只需两秒:看图里有没有表格线。后缀是 PDF 就走扫描件识别,有表格线就走表格识别,剩下的才是本页这条。
操作只有三步
把图片拖进上传区(JPG、JPEG、PNG、BMP、WEBP,一张图片算 1 页);登录后页面会显示本月剩余配额与可用总点数,以及本次预计消耗;未登录会先被引导注册(识别不向游客开放)。点击开始识别,下载同名 .txt,文字按识别顺序逐行排列。
三条硬边界,越界就别指望
不保留任何排版。 输出是纯文本,字号、颜色、加粗、分栏、表格线全部丢失,只留文字和换行。
只面向印刷体。 手写笔记请改用 手写文字识别,两者模型不同,拿手写图撞印刷体入口通常直接返回空白。
有一类内容认不了。 印章、数学公式、竖排古文,以及严重倾斜或模糊的图片。这不是参数没调好,是能力边界。
额度与单次上限
识别不向游客开放,注册(短信验证码登录即完成注册)一次性送 5 点、永久有效,VIP 会员每月另有 20~120 点配额(当月不结转),会员套餐费里已经含了这一份配额,不需要再单独买。单次上传的上限与额度是两回事:注册用户和会员都是 10 页 —— 这是同步处理的实际上限,页数再多会超时。配额用完还能买页数包,页数包永久有效,扣点顺序是先花当月会清零的配额、再花永久有效的余额。
效果差,按影响大小查三样
清晰度第一,拍摄角度第二,背景对比第三。图片长边不足 1000 像素时正文字号往往已低于可靠识别范围,容易整段漏识;拍歪、反光、阴影、手指遮挡一角都会掉识别率;彩底白字比白底黑字难认得多。长边超过 8000 像素会自动等比缩小后识别,不会失败但也不会更准。
转完之后
第一次提取的文本几乎不干净:多余断行、页眉页脚、重复行都要清。用 TXT 文本处理 删空行、删重复行、按行排序,全程在浏览器里完成、文件不上传。
隐私说一句:图片会加密发送给阿里云读光或百度智能云的识别接口,这是识别的必要环节;本站侧文件默认 24 小时后自动删除。身份证、银行卡这类照片要不要上传,先按 在线处理文件会泄露吗?在线工具的安全判断与自保方法 的判断标准过一遍。