结论前置:红色批注和铅笔字迹属于干扰物,识别面向的是印刷体正文黑字,硬上只会把题干和对错号混成一团。想做的是「把题目变成可编辑文本」,只需三步:裁掉作答区、识别纯题面、人工核对数字与专有名词。代价是每张要单独裁一次。
颜色为什么在这里是决定性的
识别拿到的一张贴纸照片,最终会被压成明暗两层。黑色印刷体与白底反差最大,笔画边界最清楚;红色在灰度化之后会变成中灰,笔画边缘发虚;铅笔更淡,稍微用力不均就断笔。结果不是「识别不出红字」这么简单,而是红字会污染它压住的那行黑字 —— 一个红勾压在题干末尾,常见输出是把句末标点吃掉,或者多出一个莫名其妙的符号。
定位方法很直接:看错误集中在哪。如果错的全是老师打过勾、画过圈、写过「阅」的位置,问题就是批注干扰,不是图片不清楚,重拍同角度没有用。
三类干扰物要分开处理
- 红笔批改(勾、叉、分数、评语):整体丢弃,只保留题面。这是最容易的一类,因为批注几乎总在作答区与题边空白。
- 铅笔作答:学生写的解答过程紧贴题干下方,浅但面积大。不要指望区分「这是题目还是这是答案」,只能靠裁剪位置。
- 蓝色或黑色手写笔迹:笔画比铅笔实,被识别的概率更高,症状是凭空多出几行不通顺的文字。这几行看起来像识别成功,实际混进了别人的作答,比整段空白更危险。
从一张整卷到可用题干的六步
- 先用 图片裁剪 把页面切成两块:纯题干区、含作答区。只要题干时,第二块直接不用。
- 四周各留一点白边,别贴着字的边缘切,切掉的半个笔画补不回来。
- 检查裁完这张图的长边还够不够清晰。长边不足 1000 像素时小字容易漏识,跌破这条线就宁可分两次识别。
- 送进 图片转文字,印刷体每页扣 1 点。
- 出来后先删空行、通读一遍题号是否连续。题号少了或跳号,说明有题目被批注盖住,那几道必须回原图手抄。
- 数字、单位、人名、地名逐个对原图核对。这类内容错一个字,题目就从「能用」变成「会误导人」。
什么时候这套做法不成立
如果目的就是把老师的评语电子化 —— 例如统计全班扣分原因 —— 这条路不划算也不可靠。批注是手写,应改用 手写文字识别,工整字迹可用,连笔、草书、字迹过密或过淡时准确率明显下降,重要内容必须人工核对。红色手写叠加在这条之上,还要再降一档。真要留评语,拍照存影像比转文字更省事。
底线判断:只要一张图上同时存在印刷题干和红笔痕迹,就不要试图一次拿到「带批注的完整文字」。把它当成两件事 —— 题面走裁剪加识别,批注留在原图。