「把扫描的合同拍照、识别成文字、丢给 AI 出摘要」这条流程看起来省了两小时,实际产出的往往是一份读起来很顺、但找不到出处的东西。原因不在模型,在喂进去的那份稿子。

错误会被放大两次

第一次放大发生在识别环节。识别错误的典型形态是形近字替换和整行漏识:「已」认成「己」、「35,000」漏成「35,00」、「违约责任」那一整段因为折行没吃进去。

第二次放大发生在 AI 环节,而且更危险:

  • AI 没有能力判断这是错字。它拿到什么就按什么理解,「己」和「已」在它眼里都是正常汉字,不会提示你"这里可能识别错了"。
  • 遇到漏掉的段落,AI 不会说"原文这里缺了一段"。它的训练目标是把上下文接顺,于是会用这类文件里最常见的表述把缺口补圆 —— 补出来的句子在原文里根本不存在。

也就是说,识别的错误是"少了几句、错了几字",经过 AI 之后变成"多了一段看着像原文的话"。后者才是真正会误导决策的部分。

三类必须逐字对原件的地方

校对不要通读,按类型扫:

  1. 数字与单位:金额、面积、比例、期限,以及万/亿、元/万元、%/‰ 这类单位
  2. 日期与编号:合同日期、证件号、单据号、订单号,一位之差就换了一个对象
  3. 名称:人名、单位全称、公司简称 —— 法人名称错一个字,指向的就是另一个主体

其余的行文错字,AI 总结时通常能容忍。但三类必核项恰好是总结里会被原样引用的部分。

四步顺序

  1. 识别:按页拿到 TXT 或 DOCX
  2. 校对:与原件对照,只改三类必核项,改动处心里有数
  3. 整理:识别稿会有大量断行和空行,直接喂 AI 会干扰分段。用 TXT处理 合并成段 —— 它支持删除空行、去除每行首尾空格和正则查找替换,处理在浏览器里完成,文本不上传服务器
  4. 提问:把约束写进问题里 —— "只依据我提供的内容回答,原文没有提到的,请直接回答未提及,不要补充"

最后这一句是整套流程里性价比最高的一步。它不能纠错,但能把"AI 编出来的部分"变成"明确承认没有",你才有机会发现缺了。

什么时候可以直接喂

只是了解大致内容、不引用具体数字、不做任何决定 —— 可以直接喂,省下的时间是真的。

反过来,合同、报销单据、病历报告、申报材料、对账单这几类不要跳步。它们共同点是会被引用,而且错一个数字就有后果。

别忘了一次隐私提醒

想让 AI 总结,前提是这份稿子先离开了你的电脑。识别本身已经把图片发给了供应商处理(详见 识别时图片发去了哪里?站内唯一一个需要交给第三方处理的工具),再交给 AI 是第二次披露。含身份证、银行卡、手机号的原件,脱敏应在识别之前,不是总结之后。

准确率到底能到多少,不要信任何单一数字,用十页样本自己测:识别准确率 98% 是宣传值还是你能拿到的?用十页样本自己测一次。如果原件本来就是文字型 PDF,走文字提取完全不需要绕这一圈:想让 AI 帮忙总结 PDF?先提取纯文本,效率更高。