Original Note
Data Wrangling(整理版) - Outline
Outline
- Data Wrangling(整理版)
- 内容简要概括
- 目录
- 1. grep、sed、awk 常用方式与参数速查
- 1.1 grep: 按行过滤文本
- 找出 sshd 相关日志
- 找出包含 Disconnected from 的 sshd 日志
- 排除某类 nightly toolchain
- 1.2 sed: 流式替换、删除与抽取
- 1.3 awk: 按字段处理文本流
- 2. Data Wrangling 的基本思路
- 3. 从远程 SSH 日志开始过滤
- 3.1 在本地过滤远程日志
- 3.2 在远程先过滤,再传回本地
- 3.3 保存过滤结果,方便本地调试
- 4. sed 与 regular expression
- 4.1 删除固定前缀
- 4.2 常见 regular expression 元字符
- 4.3 贪婪匹配与 perl 的非贪婪写法
- 4.4 匹配整行并删除整行内容
- 4.5 使用捕获组提取用户名
- 5. 提取用户名并统计频次
- 5.1 sort 与 uniq -c
- 5.2 按次数排序并取前 10 个
- 5.3 生成逗号分隔的用户名列表
- 6. awk 处理字段与条件
- 6.1 打印指定字段
- 6.2 使用 pattern 过滤行
- 6.3 使用 BEGIN 和 END 做累计
- 7. Data Wrangling to Make Arguments
- 8. Wrangling Binary Data
- 9. 可复用命令模板汇总
- 9.1 远程过滤日志并本地查看
- 9.2 保存远程过滤结果
- 9.3 从 SSH 日志提取用户名
- 9.4 统计出现最多的 10 个用户名
- 9.5 输出逗号分隔的用户名列表
- 9.6 用 xargs 把整理结果变成命令参数