一、结论先行:老格式在站内只有这一档能走
「文档批量转换」能收 .doc、.rtf、.odt 这三种老格式,并把它们转成 PDF、DOCX、TXT 三种目标之一,默认目标就是 PDF;它不能替其余 Word 面板解析老格式。站内 Word 那一族里,除这一档之外都只解 DOCX,把 .doc 丢进「Word转TXT」或「Word文件合并」,当场就是解析失败。
这一步是服务器处理,文件要上传到本站服务器处理,不登录也能用、登录后产物在文件列表里集中取。一次出几个文件就逐个下载几个,站内不打包。
二、这一档的输入输出形态
| 要处理的东西 | 这一档怎么做 | 说明 |
|---|---|---|
| .doc 老文档 | 收,经办公软件转档 | 不需要先在办公软件里另存 |
| .rtf 富文本 | 收 | 站内只有这一档处理它 |
| .odt 开放文档格式 | 收 | 同样只有这一档处理 |
| DOCX | 收 | 其余 Word 面板唯一认的格式 |
| 目标格式 | 可选 PDF、DOCX、TXT | 默认为 PDF,不选就出 PDF |
| 一批多份 | 支持 | 产物逐个下载,不打包成一个压缩包 |
三、为什么老格式只在这一档能走
差别在解析路径。这一档是把源文件交给办公软件做转档,走的是办公软件自身对这些历史格式的支持,所以老格式的兼容包袱由转档那条链路扛。其余 Word 面板走的是直接读取文档内部结构的路线,读的是 2007 及以后那套打包结构,遇到老格式的二进制结构自然读不出正文,报解析失败是设计上的取舍,不是文件坏了。
于是站内的正确分工很清楚:源文件是新格式,走对应功能的专用面板;源文件是老格式,一律先过这一档,把格式落到 DOCX 再谈后续处理。
四、分场景怎么选
- 一堆老文档要发给别人看:目标选 PDF,一次把整批转掉,不用逐份另存。
- 老格式后续还要在 Word 面板里加工,比如合并、清理格式、统计字数:目标选 DOCX,转出后再进对应面板,这一档只是把格式门槛抹平。
- 只要正文文字、不要任何排版:目标选 TXT,产物是纯文本,图片与字体排版不带过去;如果单份 DOCX 只要取字,专用面板「Word转TXT」更直接。
- 单个 DOCX 要出 PDF:走独立页「Word转PDF」更省事,不必动这一档;老格式要出 PDF 才必须留在这里。
- 扫描件、图片型文档:这一档不做文字识别,转出来仍是图像内容,取字要走识别那几条链路,别指望转档凭空多出可编辑文字。
五、按这个顺序排查转换失败
- 先分清报错的入口:报解析失败的那一步是不是 Word 面板,只有这一档能吃老格式。
- 看扩展名与真实格式是否一致:改过后缀的文档按文件头判断,照样认不出来,要按原始格式重新提交。
- 看是不是加密或损坏:读不出内容的文件任何一条链路都给不出产物,先回原件那边把限制去掉。
- 核对目标格式选没选:不选就是 PDF,想要 DOCX 或 TXT 得手动改这一项。
- 转 PDF 后目视核对版面:特殊字体在服务器缺对应字库时会被相近字体替换,这是转档类链路最常见的外观差异来源。
六、转完之后的三步验收
- 先看产物的扩展名是不是你选的目标格式:这一档默认出 PDF,没动过选择就直接按 PDF 验收,别按源文件后缀去猜。
- 再抽一份打开核对正文完整性:段落是否还在、分页是否与原件对得上、有没有整段缺失;批量转档最怕个别文件读不出内容,抽查比看总数可靠。
- 最后按下一步用途分流:还要在 Word 面板里加工的,确认手上这份是 DOCX 再提交,不要拿源文件二次去撞只解 DOCX 的那几条链路;只要文字的,目标改成 TXT 重跑一次,产物是纯文本,图片与字体排版不带过去。
七、别做这几件事
- 别把老格式往 Word 面板里塞:那一族只解 DOCX,传上去只得到一次解析失败,白跑一趟。
- 别以为默认目标会变:不选格式就出 PDF,产物格式不跟着你的源文件扩展名推。
- 别拿转档当识别:这一档做的是格式转换,不做文字识别,也不做字段抽取与翻译。
- 别等一个压缩包:一次转多份时产物逐个下载,站内不打包,需要压缩包另有压缩入口。
常见问题
问:老格式转成 DOCX 之后,还要不要再另存一次?
答:不要,产物已经是 DOCX,可以直接交给只解 DOCX 的那几条 Word 面板继续处理。
问:三种目标格式能同时选吗?
答:不能一次全出,一次提交选其中一种,默认是 PDF;要两种产物就把同一批再跑一次并换目标格式。
问:手机上能提交整批老文档吗?
答:能,入口是网页,手机浏览器即可操作,文件要上传到本站服务器处理,登录后产物在文件列表里集中取。
本站入口
入口是办公工具聚合页里的 文档批量转换 面板,整批上传 .doc、.rtf、.odt 或 DOCX,按选定的目标格式逐个出产物,默认 PDF。