文本批量清洗

多行文本一键去空行、去重复行、升序/降序排序

Ctrl+Enter 执行 · Ctrl+K 清空

输入

13

输出

字符数:0|行数:0

使用说明

粘贴多行文本,勾选清洗选项后点击「清洗」。支持去空行、去重复行、升序/降序排序。

关于文本批量清洗

文本清洗是数据处理中的常见任务。在处理日志文件、爬虫结果、用户输入、CSV 数据时,常常会遇到重复行、空行、空白行、顺序混乱等问题:日志中重复的错误记录、爬虫抓取的重复 URL、用户提交的重复数据、CSV 中的空行等。手动逐行处理效率低下,使用专门工具可以瞬间完成。

本文本清洗工具集成了多种常用清洗操作,包括去除重复行、去除空行、去除首尾空格、按字母升序 / 降序排序等,可单独使用或组合应用。基于哈希表的 O(n) 时间复杂度去重算法,可瞬间处理数万行规模的文本而无需联网。

所有清洗操作在浏览器本地完成,可处理数万行规模的文本而无需联网。对于包含敏感信息的日志或数据,可放心处理。

核心特性

一键去重

基于哈希表实现 O(n) 时间复杂度的去重,保留首次出现的行,去除后续重复行。

去除空行

自动去除空白行(包括只含空格、制表符的行),保持文本结构紧凑。

去除首尾空格

自动去除每行首尾的空格与制表符,避免空白字符导致的匹配错误。

排序功能

支持按字母升序或降序排序,方便快速查找与对比。

本地处理零上传

所有清洗操作在浏览器内完成,包含敏感信息的文本可放心处理。

使用场景

1

日志去重

排查问题时复制大量日志,去除重复错误行,快速定位关键信息。

2

URL 列表清洗

爬虫抓取的 URL 列表去除重复项与空行,避免重复请求浪费资源。

3

用户数据清洗

处理用户提交的邮箱、手机号、ID 等数据时,去除重复项后入库。

4

CSV 数据预处理

导入 CSV 数据前先去除空行与重复行,避免数据库中出现重复记录。

常见问题

去重后会保留哪一行?

本工具保留每行首次出现的实例,删除后续所有重复行。例如输入"apple\napple\nbanana",输出为"apple\nbanana"。这种策略适用于绝大多数场景,包括日志、URL、ID 列表等。

去重时区分大小写吗?

区分。"Apple" 与 "apple" 被视为不同的行,都会保留。如需不区分大小写去重,请先将文本统一转换为大写或小写再处理。

能去除前后空格不同的"重复行"吗?

勾选「去除首尾空格」选项后,会先去除每行首尾空格再进行去重," apple" 与 "apple" 会被视为相同行。

能处理多大的文本?

本工具基于浏览器 JavaScript 实现,可处理数万行规模的文本。如需处理百万行级别的大文件,建议使用命令行工具如 sort | uniq 或 awk 等专门工具。