文本处理
清洗客户名单、整理产品文字,批量处理字符与行。 本分类提供 35 个本机运行工具,涵盖去除重复行、字数与字符统计、大小写转换等实际任务。选择工具即可查看输入字段、处理规则、示例和下载结果。
去除重复行
按完整行精确去重,保留首次出现顺序。
常用工具字数与字符统计
统计 Unicode 字符、非空白字符、中文字符、英文词和行数。
文本处理大小写转换
按所选模式转换大写、小写、标题式或句首大写。
文本处理去除空行
删除没有非空白字符的行,保留其他行的原始内容。
文本处理文本行排序
使用中文区域排序规则对文本行排序。
文本处理随机打乱行
使用安全随机数进行 Fisher–Yates 洗牌。
文本处理文本反转
按 Unicode 码点倒序排列字符。
文本处理查找替换
按字面量查找并替换所有匹配,空查找词不允许。
文本处理批量添加前缀
给每一行添加同一个前缀。
文本处理批量添加后缀
给每一行添加同一个后缀。
文本处理去除首尾空格
逐行去掉首尾空格,保留行内内容。
文本处理压缩连续空格
把连续水平空白合并为一个空格,保留换行。
文本处理Tab 与空格转换
将每个 Tab 展开为指定数量的空格,保留其他字符。
文本处理全角半角转换
转换 ASCII 对应全角字符与全角空格,不改动汉字。
文本处理中文标点转换
将常见中文标点转换为英文标点。
文本处理智能引号标准化
将弯引号与长破折号换成基础直引号和短横线。
文本处理HTML 转纯文本
解析 HTML 并提取可见文本,忽略 script/style 内容。
文本处理Markdown 转纯文本
去除常用 Markdown 标记并保留文字。
文本处理文本逐行对比
比较对应行,输出增加、删除或相同标记;不是最小编辑距离算法。
文本处理两列文本差集
输出第一份文本中出现但第二份没有的完整行。
文本处理两列文本交集
输出两份文本共有的完整行并去重。
文本处理词频统计
按 Unicode 字母数字词段统计频次并降序输出。
文本处理N-gram 提取
按单词序列提取连续 N 个词组成的短语。
文本处理Slug 生成器
转小写、归一化拉丁字符并把分隔符转成连字符;保留 Unicode 字母。
文本处理模板变量替换
用 JSON 字段替换文本中的 {{字段名}},缺失变量报错。
文本处理文本分段器
按指定码点数量分段,避免拆开代理对。
文本处理文本行编号
为每一行添加递增编号。
文本处理文本定宽换行
按指定字符宽度折行,保留原有段落。
文本处理提取文本链接
从文字中提取 http/https 地址并去重。
文本处理提取文本数字
提取带正负号的小数和整数。
文本处理拉丁重音符清理
使用 Unicode NFD 分解并移除组合重音标记。
文本处理Unicode 标准化
按 NFC/NFD/NFKC/NFKD 标准化字符序列。
文本处理句子分行
按中英文句末标点拆分句子。
文本处理单词长度列表
按单词字符数降序列出不同单词。
文本处理逐行长度检查
输出每行的 Unicode 字符数与原文。
文本处理