识别输出的文本里混进了桌纹、你的拇指印旁边的乱码、还有压在下面那页露出来的一行标题 —— 这些不是识别错了,它老老实实读了你给它的所有内容。拍照识别最容易忽略的一步,就是上传前把无关部分裁掉。

哪些干扰物一定会进结果

旁边那张纸的边缘。 两页叠放时下面那页露出的半行字,会被当成正文的最后一行拼进去,读起来像一句没头没尾的话。

手指和手掌。 指尖压在字上会造出「缺笔画的字」,识别给出一个形近字而不报错,这类替换错最难发现。压得多的时候那一行直接消失。

手写的批注、勾画、便签条。 贴在页面上的便利贴文字会和正文混排,顺序按位置算,看起来就是段落被打断。

屏幕边框、装订线、表格外的印章。 印章上的弧形文字属于无法可靠识别的内容,留着它只会多出一段噪声。

裁剪的两条硬约束

第一条:别把长边裁到 1000 像素以下。文字过小时本来就容易漏识,一刀切狠了会把可用图变成废图。A4 竖拍的常见构图,横向裁掉左右桌面是安全的。

第二条:保留足够边界。单元格边框线、下划线、表格外框都参与结构判断,贴着字的边缘裁会让表格列丢失。留几毫米白边比紧贴文字裁更好。

具体做法:打开 图片裁剪,先把整页多余背景去掉,再看有没有需要单独取出的局部。密集小字区域宁可裁成两块分别识别,也不要为了凑一张而缩小。

一个可执行的最小流程

  1. 拍完先在相册里放大扫一遍,标出所有不该出现的东西:手指、便签、邻页字、印章。
  2. 用裁剪去掉四周背景,让画面只剩这一页的纸张范围。
  3. 检查剩余部分的长边与字号,放大看最小那行是否根根分明;不清楚就改成裁局部近景。
  4. 提交 图片转文字,一张图扣 1 点。
  5. 拿到文本后用 TXT处理 删空行、去重复行,接缝处重复的那一句会自动清掉。

裁剪不能替你解决的问题

裁不掉反光和虚焦。高光区间的像素已经顶满,无论怎么裁都不会回来;对不上焦的图放大后依然是糊边。这两种情况只能重拍。倾斜也一样,本站不做透视矫正,梯形页面要靠取景解决而不是靠裁。

另外,分栏排版不会自动还原。双栏文件裁完照样按位置顺序输出,左右栏的字会串在一行里。这种情况要按栏分别裁、分别识别,再手工合并。

底线判断

一页干净正文,裁不裁差别不大,直接上传就行。有遮挡、有多页重叠、有手写批注、或者你只要其中一小块(比如身份证号那一段)时,先花二十秒裁剪能省掉后面几分钟逐字核对。但要记住裁剪是有损操作,裁掉的区域再也回不来,重要材料请连同原图一起留存,服务器端处理过的文件只是临时存储,别把它当备份。