先做一次分拣:正文类走「图片转文字」出纯文本,表格类走「表格识别转Excel」出表格文件,两类分开入。混在同一份纯文本里,行列关系当场就永久丢了,之后怎么切块都补不回来。
一、入库前先把三种内容拆开
| 材料类型 | 用哪个出口 | 落地形态 | 入库注意 |
|---|---|---|---|
| 连续叙述的正文 | 「图片转文字」 | 每图一个同名 TXT | 跨页断句要先接回去 |
| 数据表、台账、报价单 | 表格识别转Excel | XLSX | 别转成散文,逐行才查得准 |
| 手写笔记 | 「手写文字识别」 | TXT | 必须校对后再入 |
表格为什么不能走纯文本:引擎按行给出单元格文字,落到 TXT 里就是一串没有列归属的字,命中后说不清哪个数字属于哪一行。走表格那条路则不同,行列位置会还原,合并单元格保持与原表一致的位置。识别完怎么交给模型提问,顺序写在「先校对再提问的四步顺序」。
二、命名这一步决定后面能不能追溯
每张图片输出一个与原图同名的文件,不会自动拼接。这个特性正好可以被利用:上传前统一改名,格式建议为"来源加日期加页序",产出自然带上出处。
三、识别输出带不进知识库的东西
只输出文字与换行:页眉、页码、边注会被一起读进来成为独立小块,污染检索,多余空行可以用「TXT处理」合掉。不做字段抽取,不会自动拆成姓名、编号、金额,想要字段化先在表格里排好列;也不做翻译。
四、入库前两条底线
- 别跳过校对:漏行是静默的,缺失处不会留标记,少一条限定条款比搜不到更糟。
- 手写稿先校再入:任何手写结果都要人工校对后再用。
常见问题
问:能不能直接把整本扫描 PDF 丢进知识库?
答:如果里面的字选得中,用转换档更合适且不消耗识别额度;选不中就是图像页,必须先识别成文本,否则检索系统看不见内容。
问:一次可以传多少页?
答:单次页数有上限,具体见工具页提示;每日识别量也有上限,超出后次日再试或联系站长。
问:加密的 PDF 能识别吗?
答:不能直接处理,要先去掉密码。加密件在转换与识别两条路上都一样受限。
本站能力与限额说明
站内 图片转文字 的做法是上传图片,由服务器识别并输出与原图同名的纯文本文件;转换在服务器端完成,服务器装有可匹配的中文字体,特殊字体可能回退,涉密材料请自行评估是否上传。
不收 GIF 与 TIFF,四个图片档不收 PDF,PDF 只走扫描件转 Word 那类入口;不还原分栏与样式,不做翻译与字段抽取,本站不承诺识别率。每一次识别都要向云服务商付费,游客不开放识别,注册后即可使用;注册赠送的识别额度永久有效,VIP 每月另有配额;通用文字与手写文字一页扣 1 点、表格 2 点、手写表格 3 点;每日识别量有上限,超出后次日再试或联系站长,价格以 会员页 为准。
识别按额度点数计、不按次数计,别把次数理解成页数。游客与未充值注册用户单文件上限 8MB,VIP 随档位递增;文件处理完保留 24 小时,到期自动清理,成品请当天下载。