很多人希望「图片转文字」也能像文本工具那样在本地完成,文件不出这台机器。做不到。原因不是懒得做,而是四道硬约束同时卡着:模型体积、浏览器内存、同步处理超时、依赖外部接口。认清这四点,你才能正确判断一次识别到底把东西交到了谁手里。

模型太大,装不进一个网页

识别汉字靠的是训练好的深度模型,参数量以亿计,装载它需要的显存和算力远超一个普通网页能调用的范围。浏览器出于安全,本来就不给页面直接支配大块 GPU 和任意大内存的能力。「TXT处理」这类之所以能本地跑,是因为去重、排序是几十行逻辑的通用算法,不需要任何模型;识别不一样,没有那套庞大的参数就没有结果。这是第一道、也是最根本的一道坎。

就算塞进去,也会在浏览器里超时

退一步假设模型压缩到能加载。一张清晰的扫描页做识别,服务端要按每页 150 DPI 渲染成图再逐块处理,长边超过 8000 像素还得先等比缩小。这些步骤放在有专用算力的服务器上尚且需要等待时间,放到用户参差不齐的设备上——尤其是手机——浏览器标签页很容易触发长时间无响应,页面直接假死或被系统回收。在线工具追求点开就出结果,同步等几十秒的体验根本没法接受。

真正干活的是第三方接口

本站的六个识别工具并不自己训练模型,而是调用供应商:通用文字由百度优先、阿里备援,表格由阿里优先、百度备援,手写表格只有阿里云读光提供,手写文字只有百度智能云提供。既然计算发生在阿里云或百度智能云的机房,图片就必须从本站转发过去,这一步无法绕过,图片会被加密后发送给对应供应商用于本次识别。所以「不上传」这句话在识别这里天然不成立。你能控制的不是传不传,而是传给谁、留多久。

边界要说清楚

识别也不是万能:印章、数学公式、竖排古文、涂改覆盖的内容无法可靠识别;字迹工整的手写可用,连笔、草书、过密过淡时准确率明显下降,重要内容必须人工核对。这些都是能力边界,和上传与否无关。

底线判断:需要绝对不出本机的材料,别指望任何在线识别,改用离线桌面软件;愿意用在线识别,就要接受图片经本站加密转发给供应商这一事实。具体机制见识别图片发给第三方供应商,入口在图片转文字。