文本
去除重复行、排序与列表处理
对按行分隔的文本列表去重、排序、随机打乱、编号并清理空白。
总行数
不重复行
重复行
空行
什么是去除重复行、排序与列表处理?
按行分隔的列表是快速处理数据时最常见的格式:邮箱地址、用户名、商品编号、网址、关键词。而需要对它们做的操作也总是那几样——去重、排序、清理多余空白。
为了删几行重复内容而打开表格软件既慢又麻烦。本工具把十个最常用的操作集中到一处,每个只需一次点击,并且直接作用于输入框中的内容,因此可以连续叠加:先去空白,再删空行,再去重,最后排序。
排序使用按语言规则的比较而非字符编码比较,因此带音调符号的文字也能落在正确的字母顺序上。随机打乱使用浏览器的密码学随机源,结果真正不可预测。
使用方法
- 把列表粘贴到输入框,每行一项。
- 查看统计卡片,立刻了解有多少重复行和空行。
- 点击需要的操作——结果会替换输入框中的内容,因此可以继续点击其他操作叠加处理。
- 完成后点击复制。
常见问题
去重保留哪一条?
保留首次出现的那一条,丢弃之后的重复项,因此列表原有顺序得以保留。若需要重新排列,之后再点排序即可。
为什么要有区分大小写的选项?
因为不同场景下判断标准不同。对邮箱地址而言 Gmail 和 gmail 是同一个,应当关闭;对商品编号或 API 密钥而言大小写有意义,必须开启。
「只保留重复项」有什么用?
它把重复的条目挑出来而不是删掉。在核对两份列表,或排查是否有数据被录入两次时很有用。
能处理多少行?
几万行依然流畅。到几十万行时浏览器会变慢,因为全部内容都保存在内存中——这种规模建议改用命令行的 sort 和 uniq。