原始笔记

Deep Learning on Cloud Nine - 大纲

  1. Deep Learning on Cloud Nine(整理版)
  2. 内容简要概括
  3. 目录
  4. 1. 学习目标与实践取舍
  5. 2. 远程 GPU 环境准备
  6. 2.1 创建或激活 conda 环境
  7. 2.2 推荐的基本检查
  8. 3. GPU 状态查看与监控
  9. 3.1 一次性查看 GPU 状态
  10. 3.2 持续监控 GPU 状态
  11. 3.3 使用 dmon 查看动态指标
  12. 4. 将训练代码迁移到 GPU
  13. 4.1 检查 CUDA 是否可用
  14. 4.2 将 model 和 tensor 移到 device
  15. 4.3 为 DataLoader 设置 CUDA 相关参数
  16. 4.4 记录训练时间与 W&B 日志
  17. 5. 训练速度优化思路
  18. 5.1 判断瓶颈在哪里
  19. 5.2 调整 batch size
  20. 5.3 调整 num_workers
  21. 6. 使用 wget 下载网络数据
  22. 6.1 下载整个目录的典型写法
  23. 6.2 下载前检查目录和空间
  24. 6.3 把下载任务放进 tmux
  25. 7. CheXzero 与 MIMIC-CXR 数据准备
  26. 7.1 克隆 CheXzero
  27. 7.2 创建 CheXzero 环境并安装依赖
  28. 7.3 下载 MIMIC-CXR 数据
  29. 7.4 检查 h5 文件
  30. 7.5 运行 CheXzero 训练
  31. 8. 常见问题与排查
  32. 8.1 `nvidia-smi` 不存在或报错
  33. 8.2 训练很慢但 GPU 空闲
  34. 8.3 h5 文件无法打开
  35. 8.4 h5 key 名称不匹配
  36. 8.5 CUDA 与 PyTorch 版本不匹配
  37. 原始教程要点

Switch to English