TXT 文本处理
在线处理 TXT 文本:自动识别 GBK 与 UTF-8 编码、统一 CRLF 或 LF 换行符、删除重复行与空行、按行排序、查找替换,并给出行数字数统计,文件不上传服务器。
拖放 TXT 文件到这里
支持 .txt .log .md .csv .json .xml .ini .srt 等纯文本(最大 20MB)· 也可以直接把文本粘贴到下面的输入框
换行与编码
浏览器的编码器只能输出 UTF-8,无法直接生成 ANSI/GBK 文件;对方系统必须是 GBK 时,用记事本打开下载结果后「另存为 → 编码 ANSI」。
行处理(按勾选顺序执行)
查找替换(作用于整段文本)
使用方法
- 1 把 TXT 文件拖进虚线框,或直接把文本粘贴到输入框。文件只在你的浏览器里读取,不会上传到服务器。
- 2 出现乱码时先在「原文件编码」里手动指定(默认自动识别 UTF-8 与 GBK),编码选对之后中文才会正常显示。
- 3 按需勾选行处理:统一换行符、删除重复行、删除空行、去除行首尾空格、排序,或填写查找替换内容后点「全部替换」。
- 4 点「处理文本」查看结果与统计,确认无误后「下载结果」或「复制结果」。
支持范围与限制
| 项目 | 说明 |
|---|---|
| 处理方式 | 全程在浏览器本地完成,文件不上传服务器,不占用每日转换次数,也不需要登录 |
| 支持输入 | 任意纯文本文件(.txt、.log、.md、.csv、.json、.xml、.ini、.srt 等)以及直接粘贴的文本 |
| 输入编码 | 自动识别 UTF-8、UTF-8 带 BOM 与 GBK/GB18030;不支持 UTF-16、Big5、EUC-KR,这类文件请先在本地转存 |
| 输出编码 | UTF-8 或 UTF-8 带 BOM。浏览器的编码器只能输出 UTF-8,因此无法直接生成 ANSI/GBK 文件;对方系统必须是 GBK 时,用记事本打开下载结果后「另存为 → 编码 ANSI」 |
| 换行符 | 可保持原样,或统一为 Windows 的 CRLF、Unix 与 macOS 的 LF |
| 行处理 | 删除重复行(保留首次出现的位置,可忽略大小写)、删除空行(只含空格的行也算空行)、去除行首尾空格、升序或降序排序 |
| 排序规则 | 按 Unicode 码位,或按中文拼音(同时具备数字感知,abc2 排在 abc10 前面),由浏览器的本地化比较能力提供 |
| 查找替换 | 对整个文本执行,可区分大小写,可启用正则表达式(JavaScript 正则语法),并显示命中次数 |
| 统计项 | 行数、字符数(含空白与不含空白)、中文字符数、按所选输出编码计算的字节数 |
| 文件大小 | 建议 20MB 以内;内容超过 5000 行或 200KB 时,输入框与输出框只显示前 500 行预览,处理、统计与下载仍按完整内容执行 |
文件安全说明
| 处理方式 | 全程在你的浏览器里完成,页面不会把文件提交到服务器 |
| 服务器副本 | 不产生,也没有上传文件或结果文件需要清理 |
| 每日次数 | 不占用免费转换次数,也不需要登录 |
| 网络请求 | 页面加载完成后不再有与文件相关的网络请求,断网也能继续处理本地文件 |
文件大小上限与支持的格式见上方「支持范围与限制」。
常见问题
我的文本会被上传到服务器吗?
不会。这个工具完全在浏览器里运行:文件由你的电脑读取、处理并生成下载,全程没有与文件相关的网络请求,服务器不留副本,因此也不占用每日免费次数、不需要登录。
打开是乱码怎么办?
乱码几乎都是编码判断错了。自动识别的规则是:先按严格 UTF-8 解码,只要出现非法字节序列就改按 GBK 解码,纯英文数字文件两者结果相同。如果识别结果不对,在「原文件编码」里手动选 UTF-8 或 GBK 再处理一次即可。
能生成 GBK 或 ANSI 编码的文件吗?
不能直接生成。浏览器提供的编码器只支持 UTF-8,这是浏览器本身的限制,不是本站省略了功能。如果对方系统必须是 GBK,请用 Windows 记事本打开下载到的 UTF-8 文件,再「文件 → 另存为 → 编码选 ANSI」保存一份。
UTF-8 和 UTF-8 带 BOM 有什么区别?
BOM 是文件开头的三个字节 EF BB BF,用来告诉程序「这是 UTF-8」。Excel 双击打开 CSV、旧版 Windows 记事本与部分国产软件需要 BOM 才不乱码;而 Linux 命令行工具、编程语言读取文件时 BOM 会被当成内容的一部分,可能报错。默认输出不带 BOM,需要给 Excel 或旧软件用时再勾选。
删除重复行会打乱原有顺序吗?
不会。按行从上到下扫描,重复的行只保留第一次出现的那一条,其余删除,顺序保持原样。勾选「忽略大小写」时,ABC 与 abc 视为同一行。
排序是按什么规则排的?
两种可选:按 Unicode 码位(与编程语言默认排序一致,中文按汉字编码顺序,不是拼音);按中文拼音(用浏览器的本地化比较,同时带数字感知,第2章 会排在 第10章 前面)。
换行符为什么需要统一?
Windows 用 CRLF(回车加换行)表示一行结束,Unix、Linux 与 macOS 用 LF。跨平台传文件时,Linux 上打开 Windows 的文本会看到每行结尾多一个 ^M,git 也会提示 CRLF 将被替换成 LF。用这个工具统一成 LF 即可消除这些差异。
能处理 Word 文档吗?
不能。.docx 是压缩包格式的二进制文件,直接拖进来会提示解析失败。请先在 Word 中「另存为 → 纯文本 (.txt)」,再用这个工具处理。
大文件会不会把浏览器卡死?
20MB 以内的文本通常一两秒就能处理完。为避免输入框渲染上百万字符导致页面卡死,超过 5000 行或 200KB 的内容只在框里显示前 500 行预览,处理与下载仍是完整内容,界面上也会标明当前处于预览状态。
相关工具
- PDF转文本 在线将 PDF 中的文字提取为 TXT 纯文本文件,方便搜索、复制和编辑,支持批量处理,免费使用。
- CSV转换 在线转换 CSV:CSV转JSON、CSV转TSV(可直接粘进 Excel)、导出带 BOM 的 UTF-8 CSV 解决 Excel 打开中文乱码,自动识别分隔符,支持筛选列与提取表头,文件不上传服务器。
- JSON格式化 在线格式化 JSON:美化缩进、压缩成一行、校验并定位出错的行列、按键名递归排序、转义与反转义、JSON转CSV,全程在浏览器里完成,数据不上传服务器。
- XML转换 在线处理 XML:格式化缩进与压缩、well-formed 校验并定位出错行列、XML转JSON、提取全部属性与 CDATA 内容,用自写解析器逐字符扫描而不依赖浏览器 DOM,文件不上传服务器。