这站识别的能力范围是一句话:能认印刷体和工整手写,不能认印章、数学公式、竖排古文和被涂改覆盖的内容,也不做翻译。这四类不是效果差一点,而是明确不提供——章是斜压在图形上的红字,公式靠二维结构表达,古文是竖排版式,涂改则把原像素破坏掉了。

一、四类各自卡在哪一步

类型为什么认不了你该怎么办
印章与骑缝章圆形排列、朱红压字,不提供印章识别单位名自己抄
数学公式分数、上下标是二维结构,输出会散成一行公式手打,只识题干文字
竖排古文不支持竖排版式,从右到左的列序读不出逐列裁图横排后再试,仍不保证
涂改覆盖内容原笔画被划掉或盖住,信息已丢失对着纸面人工辨认并记录

边界说死:能读出章旁边那几行正常印刷文字,不能把章里的字单独交给你;能认出公式里夹的中文变量名,不能还原分式结构。

二、带章的文件怎么传才不浪费点数

  1. 先想清楚要什么。多数人只要正文,公章靠肉眼抄一次就行,不必为它单独跑一遍。
  2. 章压在正文上时,把整页当普通印刷页走 图片转文字,一页扣 1 点;被完全盖住的那几个字大概率缺,位置自己补。
  3. 只有章没有别的内容的区域,别单独裁出来传,那是白扣点数。
  4. 试卷讲义先定用途:要文字底稿就传,得到的是散平的一行字;要可编辑公式,得自己在办公软件里重打。
  5. 竖排材料如果非要试,一次只传一页,看清结果再决定继续与否。

三、这几件也一样不做

  • 翻译:图上是什么语言就出什么语言,不做任何语种转换。
  • 字段抽取:不会自动拆成姓名、编号、金额这样的字段,一张单据交给你的还是一整片文字。
  • 版面还原:文字类入口只输出文字与换行,不还原分栏、表格线、图片位置和字体样式。

反过来能做的事也说清:能处理 JPG、JPEG、PNG、BMP、WEBP 这几种图片,不收 GIF 和 TIFF;多帧图片只取第一帧;透明底图片会先铺白底再拍平。

四、分场景怎么选入口

  • 纯印刷正文、截图文字:走「图片转文字」,一页 1 点,出 TXT(UTF-8 纯文本)。
  • 印刷表格、没有手写:走「表格识别转Excel」,一页 2 点,出 XLSX(2007 及以上的表格文件格式)。
  • 含手写笔迹的笔记单据:走「手写文字识别」1 点,或「手写笔记转Word」出 DOCX(2007 及以上的 Word 文档格式),后者图片和 PDF 都收且可混传。
  • 扫描件 PDF 要变可编辑文档:走「扫描件PDF转Word」,只收 PDF。

常见问题

问:章上的单位名有没有办法认出来?
答:不提供印章识别,没有绕法;这类信息按人工抄录处理,涉及核验以当地主管部门要求为准。

问:公式认不出来,整页就不能传了吗?
答:不是,正文汉字照常能认,只是公式会被压成一行乱码,事后把那段替换掉。

问:涂改液盖住的地方有补救手段吗?
答:没有,被覆盖的原笔画已经丢失,不做还原,也不承诺从上下文猜出来。

本站能力与限额说明

站内 图片转文字,把印刷体图片交给它出 TXT;识别在服务器端完成,成品请当天下载。

不能做的是:印章识别、数学公式、竖排古文、涂改覆盖内容、翻译、字段抽取,也不还原分栏和样式。额度口径:每一次识别都要向云服务商付费,所以游客不开放识别,注册后即可使用;一页扣几点按能力不同(通用文字与手写文字 1 点、表格 2 点、手写表格 3 点);每日识别量有上限。具体点数余额与每日上限以 会员页 为准。

单文件上限 8MB;文件处理完保留 24 小时,到期自动清理,已下载过的更快。识别按额度点数计、不按次数计。VIP 会员单文件上限随档位提高到 20~50MB。涉密材料请自行评估是否上传。