拿到一份外文说明书要变成中文,很多人以为这是一步操作。实际上是三步,而且本站只做得了第一步:把图上的字认出来。说清各自的边界,才不会做到一半发现路走错。
第一步:识别,输出仍然是原文语种
识别解决的是"这张图片上的字变成能选中的文字",它不翻译。日文说明书识别完出来的是日文文本,英文说明书出来的是英文文本。
还有一件事必须提前知道:本站没有语种选择参数。百度通用识别固定按中英混排优化(并自动纠正方向、按段落合并),也就是说:
- 英文、中英混排是这条路的主场景,效果最好
- 日文假名、韩文、西里尔字母、带重音的拉丁字母不在中英优化范围内,容易被认成形近的汉字、中文标点或数字 —— 不是不能用,是必须逐字核
- 竖排排版不可靠,阿拉伯文这类从右向左书写的文字更不要指望顺序正确
第二步:校对,说明书有三类高危内容
不要通读,按类型扫,因为说明书的错误代价高度集中:
- 数值与单位:mm 与 inch、kg 与 lb、℃ 与 ℉,还有小数点与千分位号 —— 德语、西班牙语等语种用逗号作小数点,和中文习惯相反。识别把小数点认丢一位,装配公差不只是一个字的问题
- 型号与序列号:字母 O 与数字 0、I 与 1 与小写 l、B 与 8 —— 订错配件、报错保修,多半从这里来
- 警示语:WARNING / CAUTION / DANGER 开头的段落常带底色框或图标,整段被漏识的概率明显高于正文。漏掉的恰恰是最不能漏的那几句
第三种最阴险:正文漏了你会察觉(句子读不通),警示语漏了结果是完整通顺的,看不出来少了东西。所以警示部分要逐条对着原件数条数,不要靠阅读感。
第三步:翻译,本站不做
本站没有翻译功能,也没有术语表、词库、译文记忆这类功能。拿到校对后的原文文本,翻译要靠翻译服务或人工。
自己翻译或交给机器翻译时,说明书有两个特殊性值得留意:同一型号名称全文必须一致(不能让工具把它译成三种说法),警示句不允许省略(机器翻译遇到不熟悉的表述会整句丢掉)。
省页数:只识别你真正要翻的段落
一本 60 页的说明书全识别 = 60 页额度,而你可能只需要其中 3 页的安装与参数部分。两种省法:
- 先裁剪再识别:用 图片裁剪 框出需要的那一段。裁剪走站内普通转换的"次"额度,不占识别页数,两者怎么各算各的见 识别用的「页」和转换用的「次」是两回事:额度到底怎么各算各的
- 注意小字:说明书字号普遍偏小,裁出来的小图长边如果不足 1000 像素,识别漏字会明显增多。宁可裁剪区域稍微大一点、离纸面近一点拍
规格表、扭矩表、参数对照表这类内容别用文字识别,走 表格识别转Excel 拿行列结构,翻译时也能保持左右对照。
顺手能做的两个优化
- PDF 原件先判断类型:能选中字的文字型 PDF,直接转换就能拿到原文,完全不需要识别、也不消耗页数,见 10 秒判断 PDF 是图片型还是文字型:判错的代价是多花一倍时间
- 带设计字体的封面、logo 上的品牌名识别不出来,能识别的只有正文那一段,见 海报上的字能识别出来吗?艺术字做不了,能做的只有正文那一段
边界一次列清
本站不做翻译、不做音频和视频转文字、不做竖排文字、不做艺术字与手写签名、不做公式(数学式与化学式都不会变成可编辑对象)、不还原原版面,也不生成对照译文的双语文件。
隐私方面多说一句:未发布产品的说明书属于敏感材料。识别是站内唯一一个要把图片交给第三方供应商处理的环节,详见 识别时图片发去了哪里?站内唯一一个需要交给第三方处理的工具。文件在本站保留 24 小时后删除,但这不等于它没有离开过你的电脑。