"把图片里的字认出来"这个需求,专业叫法是 OCR(光学字符识别)。先说结论:这件事本站目前不提供——我们的转换工具处理的是文件格式,不做图像识别。但你的问题大概率不用装 OCR 软件也能解决,因为识别能力早就内置在每天在用的东西里了。

现成可用的四条路

手机相册直接提取。 iPhone 的照片 App 长按画面里的文字就能选中复制(实况文本),大部分安卓旗舰的相册也有类似的"提取文字"入口。这条路对拍摄清晰、字体规整的画面识别率很高,日常拍通知、拍菜单、拍书页完全够用。

微信/QQ 的截图识别。 图片发给对方或自己,点开图片后长按,菜单里通常有"提取文字"/"识别图中文字"。它的强项是中文,缺点是长文容易漏行,识别完要逐段核对。

系统自带的截图工具。 Windows 的截图工具里有"文本操作",macOS 的截图也能直接识别文字,适合处理电脑屏幕上的图片。

离线专业工具。 需要批量处理上千张、或者要保留段落和表格结构时,才值得上桌面软件或自建识别服务。这类工具准确率明显更高,代价是要安装、要配置、部分要付费。

哪些情况识别结果一定不靠谱

  • 手写体:印刷体识别率能到九成以上,连笔手写经常错一半以上,目前没有通用办法
  • 表格:字能认出来,但行列关系会丢。表格要的是结构而不只是文字,最稳的做法是把原表要成电子表格文件,见 PDF 表格转 Excel
  • 倾斜、模糊、反光:拍书页的弧形、玻璃框反光的照片,识别率断崖下降。重拍时正对画面、光线均匀、避免阴影,比换工具更有效
  • 艺术字和竖排:变形字体和古文竖排是识别的难点,需要专门模型
  • 公式、拼音注音、化学式:普通 OCR 基本会打乱

图片先变成文档,再取文字

如果目的是"把一份资料变成可编辑文件",可以先按内容性质选路:

  • 一份多页的资料、要留版式存档:用 图片转 PDF 合成一份 PDF。注意这样得到的仍然是图像型 PDF,文字选不动,需要识别才能编辑
  • 本来就有的文字版 PDF(鼠标能选中文字):直接用 PDF 转文本 取字,或 PDF 转 Word 保留段落,这两条路不需要识别,准确率是百分之百
  • 扫描件(选不动字的 PDF)想转 Word:这一步同样绕不开识别,现实做法见 扫描版 PDF 转 Word 的现实做法

拿到文字之后要做的两件事

识别出来的文本一定要过一遍。常见的三类错误:数字与字母混淆(0 和 O、1 和 l)、标点丢失或全半角错乱、段落被拆成一行一行。粘出来的碎文本可以先用 删除空行 把识别造成的空行和断行清理掉,再用 文本字数统计 核对有没有整段漏识别;如果内容已经落在 Word 里而版式乱得没法收拾,用 Word格式清理 可以把它压成纯文本再重新排版。

如果识别出来的是几十页碎文本,还要发给别人,建议整理完再导出成一份干净的 PDF,比发一堆截图更容易被阅读和检索。