四步的固定顺序:先去空行,再去多余空格,再做全角转半角,最后才去重。原因是前三步都在让相同的行真正变得相同,去重必须放在形态统一之后,否则它只能认出完全一模一样的两行。
一、每一步在做什么
- 去空行:连续空行压成一处,行首行尾空白清掉。这一步不动内容,只让行数回到真实值。
- 去多余空格:词之间留一个半角空格,制表符换成空格,行内连续空格压成一个。这步最容易被跳过,也最容易让去重失效。
- 全角转半角:参与匹配与编号的括号、冒号、逗号、数字、字母统一成半角。混合形态是搜不到、替不掉的主因。
- 去重:决定要不要区分大小写、要不要保留首次出现位置。
二、跳过某步会留下什么
| 跳过的步骤 | 典型后果 |
|---|---|
| 不去空行 | 行数虚高,统计条目数偏多一倍 |
| 不去多余空格 | 看着一样的重复行删不掉 |
| 不做全角转半角 | 搜关键词一条都搜不到 |
| 不去重 | 求和或计数结果偏大 |
三、动手前的两项准备
- 先复制一份原件作基线,清洗永远在新副本上做,出问题时能回到起点比对。
- 抽样二十行看清脏在哪里:行尾空格、全角数字,还是编码问题导致的问号。脏源不同,第 2 步和第 3 步的力度不同。
- 需要批量改字面的,放在第 3 步之后做。
站内 TXT 文本处理 把这几类操作放在一起可按需勾选,但勾选顺序仍要按本节排。若原文里有大量无意义空行,可先用 删除空行 单独压一遍再看剩余问题。
四、别做这几件事
- 不要用编辑器的自动整形代替规则清洗:它会顺手改行宽与断行位置,把一行拆成两行,破坏后面的逐行比对。
- 不要在语义空行上去空行:分段用的空行有意义,先确认再压。
- 不要攒到一起洗:多来源合并时按来源分别清洗再合并去重,混在一起会掩盖来源差异。
常见问题
问:中文标点也要转半角吗?
答:句末标点建议保留全角,只有参与匹配、编号、代码引用的括号冒号逗号数字才转半角,否则破坏可读性。
问:几千行的文件手机上能处理吗?
答:可以上传处理,抽查环节建议在电脑上做。单文件超过免费额度时需要会员。
问:会不会把不该删的行删掉?
答:去重的判定是整行完全一致,前三步做完后被删掉的必然是形态重复行。
本站能力与限额说明
站内 TXT 文本处理(/doc-tools/txt-process)按上述顺序提供去空行、空白规整、全角半角转换与重复行清理等操作用于整理纯文本;转换在服务器端完成,服务器装有可匹配的中文字体,特殊字体可能回退,涉密材料请自行评估是否上传。
本站不做翻译、不做 AI 改写润色,也不承诺修复已损坏编码的原文;输入需要是可读的纯文本文件。
游客与未充值注册用户单文件上限 8MB、每天 5 次成功转换;充值 VIP 会员后单文件上限提高到 20~50MB(随档位递增),转换次数不限,各档当前售价与额度以 会员页 为准。文件处理完保留 24 小时,到期自动清理,成品请当天下载。