拿到一份外文说明书要变成中文,很多人以为这是一步操作。实际上是三步,而且本站只做得了第一步:把图上的字认出来。说清各自的边界,才不会做到一半发现路走错。

第一步:识别,输出仍然是原文语种

识别解决的是"这张图片上的字变成能选中的文字",它不翻译。日文说明书识别完出来的是日文文本,英文说明书出来的是英文文本。

还有一件事必须提前知道:本站没有语种选择参数。百度通用识别固定按中英混排优化(并自动纠正方向、按段落合并),也就是说:

  • 英文、中英混排是这条路的主场景,效果最好
  • 日文假名、韩文、西里尔字母、带重音的拉丁字母不在中英优化范围内,容易被认成形近的汉字、中文标点或数字 —— 不是不能用,是必须逐字核
  • 竖排排版不可靠,阿拉伯文这类从右向左书写的文字更不要指望顺序正确

第二步:校对,说明书有三类高危内容

不要通读,按类型扫,因为说明书的错误代价高度集中:

  1. 数值与单位:mm 与 inch、kg 与 lb、℃ 与 ℉,还有小数点与千分位号 —— 德语、西班牙语等语种用逗号作小数点,和中文习惯相反。识别把小数点认丢一位,装配公差不只是一个字的问题
  2. 型号与序列号:字母 O 与数字 0、I 与 1 与小写 l、B 与 8 —— 订错配件、报错保修,多半从这里来
  3. 警示语:WARNING / CAUTION / DANGER 开头的段落常带底色框或图标,整段被漏识的概率明显高于正文。漏掉的恰恰是最不能漏的那几句

第三种最阴险:正文漏了你会察觉(句子读不通),警示语漏了结果是完整通顺的,看不出来少了东西。所以警示部分要逐条对着原件数条数,不要靠阅读感。

第三步:翻译,本站不做

本站没有翻译功能,也没有术语表、词库、译文记忆这类功能。拿到校对后的原文文本,翻译要靠翻译服务或人工。

自己翻译或交给机器翻译时,说明书有两个特殊性值得留意:同一型号名称全文必须一致(不能让工具把它译成三种说法),警示句不允许省略(机器翻译遇到不熟悉的表述会整句丢掉)。

省页数:只识别你真正要翻的段落

一本 60 页的说明书全识别 = 60 页额度,而你可能只需要其中 3 页的安装与参数部分。两种省法:

规格表、扭矩表、参数对照表这类内容别用文字识别,走 表格识别转Excel 拿行列结构,翻译时也能保持左右对照。

顺手能做的两个优化

边界一次列清

本站不做翻译、不做音频和视频转文字、不做竖排文字、不做艺术字与手写签名、不做公式(数学式与化学式都不会变成可编辑对象)、不还原原版面,也不生成对照译文的双语文件。

隐私方面多说一句:未发布产品的说明书属于敏感材料。识别是站内唯一一个要把图片交给第三方供应商处理的环节,详见 识别时图片发去了哪里?站内唯一一个需要交给第三方处理的工具。文件在本站保留 24 小时后删除,但这不等于它没有离开过你的电脑。