文本去重
文本去重工具
工具简介
文本去重工具支持按行、按分隔符、按正则匹配三种去重模式,可处理纯文本、CSV、TSV、日志行、代码片段等多种格式。提供大小写敏感/不敏感、全角/半角归一化、空白字符归一化等高级选项。批量处理 10 万行级别文本在浏览器本地秒级完成,适合清洗爬虫数据、日志去重、名单合并、代码片段整理。所有处理完全本地,数据不上传服务器。
使用步骤
1
选择去重模式
顶部选择「按行」「按分隔符」「按正则」模式,设置分隔符或正则表达式。勾选「大小写不敏感」「全角半角归一」等选项。
2
粘贴文本
在输入框粘贴待去重的文本(每行一条记录),或拖入 .txt/.csv/.log 文件,最大支持 100 万行。
3
点击去重
点击「去重」按钮,工具本地处理秒级完成。结果显示「原始行数 / 重复行数 / 去重后行数」统计,一键复制或导出 csv。
常见问题
三种去重模式有什么区别?
「按行去重」逐行比较,适合文本文件、日志;「按分隔符去重」按逗号/Tab/竖线分割后整行比较,适合 CSV 字段;「按正则去重」提取正则匹配的子串作为去重 key,适合从 URL 中提取域名、从日志中提取用户 ID 等场景。
大小写归一化和全角半角转换有什么用?
大小写归一:把「Hello」「hello」「HELLO」视为相同;全角半角转换:把「123」「123」视为相同;空白归一:把多个空格/制表符视为相同。这些选项能显著提升去重率,但可能改变原文本,建议先备份。
能保留重复行的统计信息吗?
可以。开启「保留统计」选项,工具会额外输出每个重复值出现的次数,类似 SQL 的 COUNT(*) GROUP BY 效果。结果可导出为 csv(原行,重复次数)。
10 万行级别处理会不会卡?
不会。浏览器本地处理,使用 Set 数据结构,100 万行去重约 2-3 秒。建议 100 万行以内直接处理,超出可分段提交。处理过程实时显示进度,可随时取消。