先做一次分拣:正文类走「图片转文字」出纯文本,表格类走「表格识别转Excel」出表格文件,两类分开入。混在同一份纯文本里,行列关系当场就永久丢了,之后怎么切块都补不回来。

一、入库前先把三种内容拆开

材料类型用哪个出口落地形态入库注意
连续叙述的正文「图片转文字」每图一个同名 TXT跨页断句要先接回去
数据表、台账、报价单表格识别转ExcelXLSX别转成散文,逐行才查得准
手写笔记「手写文字识别」TXT必须校对后再入

表格为什么不能走纯文本:引擎按行给出单元格文字,落到 TXT 里就是一串没有列归属的字,命中后说不清哪个数字属于哪一行。走表格那条路则不同,行列位置会还原,合并单元格保持与原表一致的位置。识别完怎么交给模型提问,顺序写在「先校对再提问的四步顺序」。

二、命名这一步决定后面能不能追溯

每张图片输出一个与原图同名的文件,不会自动拼接。这个特性正好可以被利用:上传前统一改名,格式建议为"来源加日期加页序",产出自然带上出处。

三、识别输出带不进知识库的东西

只输出文字与换行:页眉、页码、边注会被一起读进来成为独立小块,污染检索,多余空行可以用「TXT处理」合掉。不做字段抽取,不会自动拆成姓名、编号、金额,想要字段化先在表格里排好列;也不做翻译。

四、入库前两条底线

  • 别跳过校对:漏行是静默的,缺失处不会留标记,少一条限定条款比搜不到更糟。
  • 手写稿先校再入:任何手写结果都要人工校对后再用。

常见问题

问:能不能直接把整本扫描 PDF 丢进知识库?
答:如果里面的字选得中,用转换档更合适且不消耗识别额度;选不中就是图像页,必须先识别成文本,否则检索系统看不见内容。

问:一次可以传多少页?
答:单次页数有上限,具体见工具页提示;每日识别量也有上限,超出后次日再试或联系站长。

问:加密的 PDF 能识别吗?
答:不能直接处理,要先去掉密码。加密件在转换与识别两条路上都一样受限。

本站能力与限额说明

站内 图片转文字 的做法是上传图片,由服务器识别并输出与原图同名的纯文本文件;转换在服务器端完成,服务器装有可匹配的中文字体,特殊字体可能回退,涉密材料请自行评估是否上传。

不收 GIF 与 TIFF,四个图片档不收 PDF,PDF 只走扫描件转 Word 那类入口;不还原分栏与样式,不做翻译与字段抽取,本站不承诺识别率。每一次识别都要向云服务商付费,游客不开放识别,注册后即可使用;注册赠送的识别额度永久有效,VIP 每月另有配额;通用文字与手写文字一页扣 1 点、表格 2 点、手写表格 3 点;每日识别量有上限,超出后次日再试或联系站长,价格以 会员页 为准。

识别按额度点数计、不按次数计,别把次数理解成页数。游客与未充值注册用户单文件上限 8MB,VIP 随档位递增;文件处理完保留 24 小时,到期自动清理,成品请当天下载。