看你要不要把版面一起带走:要保留分段与结构、直接挂上网页,走转 HTML,出一个独立网页文件;只要干净文字灌进自己的模板,走转文本,出一个 UTF-8 的 TXT,段落缩进与表格排版全部不保留。两条链路都只读文件里已有的文字层,页数上限都按一次提交里所有文件合计判定,超限当场拒绝,具体数字以页面提示为准。
一、两条链路的分工表
| 比这一项 | 转 HTML | 转文本 |
|---|---|---|
| 产物 | 一个 PDF 出一个独立的 .html 文件 | 一个 PDF 出一个 .txt 文件 |
| 打开方式 | 浏览器双击就能看 | 任何文本编辑器都能开 |
| 内容形态 | 真实文本,可选中、可复制、可被检索 | 只有文字内容 |
| 版面与分段 | 大体沿用,复杂结构有差异 | 缩进、表格排版全部不保留 |
| 输出编码 | 固定 UTF-8 | UTF-8 纯文本 |
| 页数判定 | 按一次提交所有文件合计,以页面提示为准 | 同左 |
| 一次文件数 | 最多 15 个,只收 PDF | 最多 15 个,只收 PDF |
| 参数可调 | 无任何开关 | 无任何开关 |
两条都不合并、不打包,几个输入就几个产物,逐个下载。判定口径也一致:超限当场拒绝,不出半成品;加密或损坏的 PDF 读不出页数直接拒收,要先把打开密码去掉。
二、按场景挑,别按习惯挑
- 内容要直接被搜到:走 HTML。文字在网页里是真实文本,搜索引擎抓得到,也复制得走;转文本虽然也能拿到字,但你还得自己搭一层页面。
- 要塞进现成的网站模板或内容系统:走 PDF转文本。省掉一层网页结构,也就少一处编码和样式打架的地方,套自己的排版更干净。
- 要给人看目录层级、分节结构:走 HTML。分段与小标题的层次还在,只是多栏排版、浮动图表这类复杂结构会有差异,转后要微调。
- 要拿去校对、比对、做后续文字处理:走文本。纯文本更适合按行处理,也不会带出一堆结构符号。
- 原件根本没有文字层:两条都变不出字来。判定方法是在 PDF 里能不能拖动选中一行字,选不中的页面没有可读的文字层,编码和格式怎么换都没用。
- 只要中间那几页:两条都没有页码选项,都得先用「PDF拆分」把那几页拆成单独文件再转。
三、拿到产物之后的收尾动作不一样
网页那份:先在浏览器里从头到尾翻完,重点核对分段有没有断开、小标题层级还在不在、多栏和浮动图表的位置偏了多少;确认中文显示正常后再挂模板,挂之前别用编辑器乱存,免得把 UTF-8 的编码声明改换掉。要小修就用文本编辑器打开,只改结构和文字,保存时编码保持原样。
文本那份:先检查换行——这类转换只保文字,长段落在原文里的断行方式可能和你排版器要的不一样,通读一遍比直接粘贴省事;然后灌进内容系统,排版、字号、缩进全部由你的模板来定。要只取其中几页,先拆分再转,别在成品里手工抠,抠完还容易留下半句话。
两条共用的判断:先想清楚读者在哪里看。挂在公开网页上、要被人搜到,选 HTML;进内容系统、后面还要二次加工,选文本。产物形态定了,剩下的都是细节。
四、这几件事别做
- 不要指望转文本还能保住表格。这条链路明确只保留文字内容,表格的行列关系、缩进、对齐全部丢掉,出来的是一行行文字。
- 不要以为 HTML 那条能顺手帮你排好版。它做的是把内容搬进网页结构,不做美化,复杂版面转后要自己微调。
- 不要拿转文本当取字工具。没有文字层的页面在这条链路里读不出字,要先把正文取成可编辑文字,走 扫描件PDF转Word,再决定排到哪里。
- 不要为了对比效果一次传太多。两个入口都是一次最多 15 个文件、页数按整批合计判定,超限当场拒绝,先各拿三五页试更省时间。
五、能保住可检索的文本,不能保住没有文字层的内容
能把有文字层的 PDF 转成可检索、可复制的网页文本或干净 TXT,不能在转换这一步给没有文字层的页面补出字来,也不能替你把版面重排成网页样式。这句话是这两条链路共同的边界,选哪个都绕不过去。
再补一条容易误判的点:两个入口都没有清晰度、质量、排版模式之类的选项,传进去什么样就出什么样。所以「换一种输出格式能不能让结果更好」这个问题,答案通常是不能,差别只在你要不要版面结构,而不是哪种格式更精细。真要控制结果,能动的只有输入:换一份导出来源更干净的原件,或者先拆分再转。
常见问题
问:手机上能选哪个?
答:两个入口都能用,选择标准不变;只是转 HTML 之后要微调版面,回到电脑上做更顺手。
问:不登录能用吗?产物去哪儿取?
答:两条链路不登录也能用;登录后产物集中在文件列表里取,两种格式各转一批时,在列表里好核对谁出了、谁没出。
问:两种结果能不能混着用?
答:能,而且这是常见做法——先用 HTML 那份核对分段是否完整,再拿文本那份灌进模板;两边都出自同一个原件,两批提交各按各的文件数和合计页数判定,别把两种输出混在同一次提交里凑数。
本站入口
这一步在站内是 PDF转HTML,文件要上传到本站服务器处理,输出一个独立网页文件、浏览器双击就能看;只要干净文字就改走 PDF转文本,输出 UTF-8 纯文本、不带排版。
产物拿到后,网页那份先在浏览器里过一遍分段再挂模板,文本那份通读检查换行后直接灌进内容系统;版面差异都靠转后微调,不必反复重转。