TXT 文本处理

在线处理 TXT 文本:自动识别 GBK 与 UTF-8 编码、统一 CRLF 或 LF 换行符、删除重复行与空行、按行排序、查找替换,并给出行数字数统计,文件不上传服务器。

拖放 TXT 文件到这里

支持 .txt .log .md .csv .json .xml .ini .srt 等纯文本(最大 20MB)· 也可以直接把文本粘贴到下面的输入框

原文件编码

换行与编码

浏览器的编码器只能输出 UTF-8,无法直接生成 ANSI/GBK 文件;对方系统必须是 GBK 时,用记事本打开下载结果后「另存为 → 编码 ANSI」。

行处理(按勾选顺序执行)

查找替换(作用于整段文本)

使用方法

  1. 1 把 TXT 文件拖进虚线框,或直接把文本粘贴到输入框。文件只在你的浏览器里读取,不会上传到服务器。
  2. 2 出现乱码时先在「原文件编码」里手动指定(默认自动识别 UTF-8 与 GBK),编码选对之后中文才会正常显示。
  3. 3 按需勾选行处理:统一换行符、删除重复行、删除空行、去除行首尾空格、排序,或填写查找替换内容后点「全部替换」。
  4. 4 点「处理文本」查看结果与统计,确认无误后「下载结果」或「复制结果」。

支持范围与限制

项目 说明
处理方式 全程在浏览器本地完成,文件不上传服务器,不占用每日转换次数,也不需要登录
支持输入 任意纯文本文件(.txt、.log、.md、.csv、.json、.xml、.ini、.srt 等)以及直接粘贴的文本
输入编码 自动识别 UTF-8、UTF-8 带 BOM 与 GBK/GB18030;不支持 UTF-16、Big5、EUC-KR,这类文件请先在本地转存
输出编码 UTF-8 或 UTF-8 带 BOM。浏览器的编码器只能输出 UTF-8,因此无法直接生成 ANSI/GBK 文件;对方系统必须是 GBK 时,用记事本打开下载结果后「另存为 → 编码 ANSI」
换行符 可保持原样,或统一为 Windows 的 CRLF、Unix 与 macOS 的 LF
行处理 删除重复行(保留首次出现的位置,可忽略大小写)、删除空行(只含空格的行也算空行)、去除行首尾空格、升序或降序排序
排序规则 按 Unicode 码位,或按中文拼音(同时具备数字感知,abc2 排在 abc10 前面),由浏览器的本地化比较能力提供
查找替换 对整个文本执行,可区分大小写,可启用正则表达式(JavaScript 正则语法),并显示命中次数
统计项 行数、字符数(含空白与不含空白)、中文字符数、按所选输出编码计算的字节数
文件大小 建议 20MB 以内;内容超过 5000 行或 200KB 时,输入框与输出框只显示前 500 行预览,处理、统计与下载仍按完整内容执行

文件安全说明

处理方式 全程在你的浏览器里完成,页面不会把文件提交到服务器
服务器副本 不产生,也没有上传文件或结果文件需要清理
每日次数 不占用免费转换次数,也不需要登录
网络请求 页面加载完成后不再有与文件相关的网络请求,断网也能继续处理本地文件

文件大小上限与支持的格式见上方「支持范围与限制」。

常见问题

我的文本会被上传到服务器吗?

不会。这个工具完全在浏览器里运行:文件由你的电脑读取、处理并生成下载,全程没有与文件相关的网络请求,服务器不留副本,因此也不占用每日免费次数、不需要登录。

打开是乱码怎么办?

乱码几乎都是编码判断错了。自动识别的规则是:先按严格 UTF-8 解码,只要出现非法字节序列就改按 GBK 解码,纯英文数字文件两者结果相同。如果识别结果不对,在「原文件编码」里手动选 UTF-8 或 GBK 再处理一次即可。

能生成 GBK 或 ANSI 编码的文件吗?

不能直接生成。浏览器提供的编码器只支持 UTF-8,这是浏览器本身的限制,不是本站省略了功能。如果对方系统必须是 GBK,请用 Windows 记事本打开下载到的 UTF-8 文件,再「文件 → 另存为 → 编码选 ANSI」保存一份。

UTF-8 和 UTF-8 带 BOM 有什么区别?

BOM 是文件开头的三个字节 EF BB BF,用来告诉程序「这是 UTF-8」。Excel 双击打开 CSV、旧版 Windows 记事本与部分国产软件需要 BOM 才不乱码;而 Linux 命令行工具、编程语言读取文件时 BOM 会被当成内容的一部分,可能报错。默认输出不带 BOM,需要给 Excel 或旧软件用时再勾选。

删除重复行会打乱原有顺序吗?

不会。按行从上到下扫描,重复的行只保留第一次出现的那一条,其余删除,顺序保持原样。勾选「忽略大小写」时,ABC 与 abc 视为同一行。

排序是按什么规则排的?

两种可选:按 Unicode 码位(与编程语言默认排序一致,中文按汉字编码顺序,不是拼音);按中文拼音(用浏览器的本地化比较,同时带数字感知,第2章 会排在 第10章 前面)。

换行符为什么需要统一?

Windows 用 CRLF(回车加换行)表示一行结束,Unix、Linux 与 macOS 用 LF。跨平台传文件时,Linux 上打开 Windows 的文本会看到每行结尾多一个 ^M,git 也会提示 CRLF 将被替换成 LF。用这个工具统一成 LF 即可消除这些差异。

能处理 Word 文档吗?

不能。.docx 是压缩包格式的二进制文件,直接拖进来会提示解析失败。请先在 Word 中「另存为 → 纯文本 (.txt)」,再用这个工具处理。

大文件会不会把浏览器卡死?

20MB 以内的文本通常一两秒就能处理完。为避免输入框渲染上百万字符导致页面卡死,超过 5000 行或 200KB 的内容只在框里显示前 500 行预览,处理与下载仍是完整内容,界面上也会标明当前处于预览状态。

相关工具