只为了搜一个词就走转文本,成本最低:产出的纯文字能直接全文查找,识别页数也最省。要改内容才转 Word。加密件必须先解密,否则任何一步都做不了。
一、判断只看一个问题
后面要不要编辑这份材料?答案是「不」,就转文本;是「要」,才转 Word。这个判断决定额度消耗和整理时间,别一上来就奔着可编辑格式去。
二、三条路对照
| 目标 | 选择 | 代价与结果 |
|---|---|---|
| 只查关键词、摘段落 | 识别后取纯文本 | 额度最省,排版全部丢失 |
| 要改措辞、重排版式 | 扫描件PDF转Word | 耗时最长,表格易散架 |
| 本身就是文字型 PDF | 直接转成纯文本 | 不走识别,几乎零成本 |
三、操作步骤
- 先判定案卷类型:能选中文字的属文字型,走 PDF转文本,不要浪费识别额度。
- 打不开的加密件,先用 PDF 解密去密码再进下一步。
- 扫描件走识别工具,单次页数有上限,见工具页提示,几百页按卷拆份处理。
- 拿到文本后用本地办公软件查找定位关键词,批量替换走办公聚合页的查找替换面板。
- 每处命中回到原页核对一次,识别产生的同音错字只有对着原件才发现得了。
四、必须说清的限制
- 转换档不提供 OCR:扫描图片丢进普通转换工具,出来仍是空白或乱码,这不是故障。
- OCR 输入一般不收 PDF:只有两个识别类工具接收 PDF。
- 不承诺识别率:印刷体清晰度、倾斜、复印件发灰都影响结果。
- 表格与脚注最容易乱:编号列错位时,宁可回原页手抄关键行。
五、让检索更快
- 关键词准备两三个变体,简称全称各搜一遍,漏的多半是写法不一。
- 命中位置记下原页码,引用时能精确指到第几页。
- 反复要查的案件,把转好的文本留在本地,不必每次重新识别。
- 提交时另存一份带页码的正式版,检索稿与提交稿分开。
常见问题
问:识别要花多少额度?
答:按页数扣减,印刷通用内容 1 页 1 点,表格类 1 页 2 点,手写表格 1 页 3 点;注册用户有一次性赠送额度,VIP 每月另有。
问:手机上能做吗?
答:上传与识别在浏览器即可完成,但几百页的核对在小屏上效率很低,手机上只先跑一遍看有没有命中。
问:传上去别人也能看到吗?
答:文件在服务器临时存储,默认保留 24 小时后自动删除,已下载过的更快清理;涉密材料请自行评估。
本站能力与限额说明
站内扫描件PDF转Word负责把扫描页变成可读稿件,PDF转文本用于文字型文件的低成本抽取,办公聚合页上的查找替换面板(/office-tools#panel-find-replace)负责批量定位与统一写法;处理在服务器端完成,服务器装有可匹配的中文字体,特殊字体可能回退,涉密材料请自行评估是否上传。
每日识别量有上限,超出后次日再试或联系站长;加密 PDF 需先去密码才能转换,DWG 图纸不在支持范围内,只读 DXF。游客与未充值注册用户单文件上限 8MB、每天 5 次成功转换;VIP 会员单文件上限提高到 20~50MB(随档位递增),次数不限,各档售价以 会员页 为准。文件保留 24 小时到期清理,成品当天下载。