Original Note
Deep Learning on Cloud Nine - Outline
Outline
- Deep Learning on Cloud Nine(整理版)
- 内容简要概括
- 目录
- 1. 学习目标与实践取舍
- 2. 远程 GPU 环境准备
- 2.1 创建或激活 conda 环境
- 2.2 推荐的基本检查
- 3. GPU 状态查看与监控
- 3.1 一次性查看 GPU 状态
- 3.2 持续监控 GPU 状态
- 3.3 使用 dmon 查看动态指标
- 4. 将训练代码迁移到 GPU
- 4.1 检查 CUDA 是否可用
- 4.2 将 model 和 tensor 移到 device
- 4.3 为 DataLoader 设置 CUDA 相关参数
- 4.4 记录训练时间与 W&B 日志
- 5. 训练速度优化思路
- 5.1 判断瓶颈在哪里
- 5.2 调整 batch size
- 5.3 调整 num_workers
- 6. 使用 wget 下载网络数据
- 6.1 下载整个目录的典型写法
- 6.2 下载前检查目录和空间
- 6.3 把下载任务放进 tmux
- 7. CheXzero 与 MIMIC-CXR 数据准备
- 7.1 克隆 CheXzero
- 7.2 创建 CheXzero 环境并安装依赖
- 7.3 下载 MIMIC-CXR 数据
- 7.4 检查 h5 文件
- 7.5 运行 CheXzero 训练
- 8. 常见问题与排查
- 8.1 `nvidia-smi` 不存在或报错
- 8.2 训练很慢但 GPU 空闲
- 8.3 h5 文件无法打开
- 8.4 h5 key 名称不匹配
- 8.5 CUDA 与 PyTorch 版本不匹配
- 原始教程要点