老师录入题库的真实耗时,大头不在识别,在识别完之后那一堆断行、题号错位和空出来的图形位置。先把流程排对,比找"最准的识别软件"省时间得多。
先算这一批要多少页
识别按页扣点,一张图算 1 页、一份 PDF 按它的实际页数算;试卷走通用文字识别,每页扣 1 点。所以:
- 一本 40 页的试卷 = 40 页 = 40 点
- A4 双面打印的一份卷子,一张纸是 2 页
- 单次上传最多 10 页,40 页要分 4 次提交 —— 这是同步处理不超时的约束,不是卡额度
- 每月额度按身份给:注册一次性送 5 点、永久有效,VIP 会员每月另有 20~120 点配额(当月不结转)
一整叠卷子通常上百页,赠送的 5 点只够你验证流程能不能跑通。先用 5 页试出切分方法,再决定买多少点数:OCR 页数包怎么买:两档价格、永久有效,以及先扣月配额还是先扣余额。
切分靠题号,不靠版面
必须知道的限制:识别不还原版面。分栏会被拍平、字号和加粗不保留、每页之间只有一个分页符。也就是说整卷文字会连成一大片,题库要的"一题一条"必须自己切。
题号是这里最可靠的锚点 —— 它短、独立、格式统一。用 TXT处理 的查找替换处理(勾选"正则表达式",替换框留空即为删除,执行后会给出处数,可以确认切了几处):
- 把每题切成独立块:勾选正则后,查找框填 ^\d{1,2}[.、] 这个模式,含义是"行首的 1 到 2 位数字,后面跟一个点或顿号";执行后核处数是否接近题量
- 删掉换行造成的碎行:题干被折行的地方,需要人工合并 —— 这一步没有稳妥的自动办法,正则误伤的概率比重排的时间高
- 删除空行:勾「删除空行」一次性处理
一整本答案册合并后的文本可能很大。「TXT处理」有保护机制:超过约 5000 行或 200KB 时,输入框只显示前 500 行预览并置为只读,但处理和下载用的是完整文本 —— 看到"只读"不是文件被截断,也不用担心后半本丢了。
公式和图形:不要指望识别
本站不做公式识别。也就是说:
- 分数、根号、上下标、方程式会被认成一串普通字符甚至乱码,不会变成 Word 公式对象或 LaTeX
- 几何图、函数图像、统计图、电路图的图形本身完全不输出,只有图旁边的文字标注会被识别
- 英语听力、音乐谱表这类以音频为载体的题,不在能力范围内(不做音频转文字)
结论:这类题不要"转文字",要转图片。把原卷按页转成图片存进题库,文字部分只录题干和选项,图形以图存图。整页转图片可用 PDF转图片。
两种特殊情况要换功能
- 选择题答题卡、成绩统计表:要的是行列结构不是文字流,走 表格识别转Excel。注意识别出的数字会按文本写入单元格,求和前要先转数值:图片转 Excel 后数字不能求和?按文本写入是故意的
- 已经作答的手写卷子:走手写体识别,且只有工整手写可用、连笔潦草准确率明显下降、务必人工校对。批注性笔迹、涂改过的答案通常认不出来
入库前的两处抽查
不用通读,只查两类最容易错的地方:选项字母(A/B/C/D 与数字、括号混排时会被认错)和题号(两位题号偶尔并进上一题末尾)。这两处一错,题目就会整块错位,比正文错字严重得多。
最后说清输出边界
本站输出 TXT、DOCX、XLSX 三种格式,不生成任何题库平台的导入模板,也不判断题目难度、知识点标签和答案正确性。需要对齐平台字段时,先用「表格识别转Excel」拿到行列结构,再自行映射列名 —— 这一步省不掉,各家题库的导入格式并不通用。