AutoDL使用攻略
·
目录
环境准备
-
选择合适的GPU资源

- CPU 22 核:代表它有 22 个物理内核。这意味着它能同时高效处理 22 个大型任务,在运行高度并行的程序(如数据预处理、编译代码)时速度极快。
- 内存110GB: 这远超普通电脑(通常 8GB-32GB)。决定了你能同时加载多少数据。在 AI 领域,大内存意味着你可以一次性读入更大的数据集,运行参数量巨大的模型不会因为内存溢出。
- 系统盘30GB:仅安装操作系统、基础库。
- 数据盘:存放数据集、模型权重、训练代码、日志、checkpoint。
- GPU驱动:决定你能安装的 CUDA 版本上限。
- CUDA版本≤ 13.0:只要 PyTorch 自带的 CUDA 版本≤ 系统驱动支持的 CUDA 版本,即可正常运行。例如,在支持 CUDA 13.0 的驱动上安装基于 CUDA 12.1 编译的 PyTorch 是完全可行且稳定的。
- 实例创建
- 选择镜像(PyTorch/TensorFlow等深度学习框架)
数据上传与管理

- 创建实例后可使用JupyterLab进行操作(点击进入JupyterLab)

- 可点击上传文件,将上传你的数据集以及代码
- 建议将上传的文件放入autodl-tmp,因为它是数据盘,空间大。
代码运行与调试
- 通过Jupyter Notebook执行代

- 使用Terminal安装额外依赖库

- 监控GPU显存和资源占用(
nvidia-smi命令)
- 如果不小心关掉终端,可在这个位置找回。
结果保存与下载

- 将训练好的模型权重和日志,通过指令: zip -r 输出文件名.zip 要压缩的目录 。打包为压缩文件下载
补充

在更多部分有无卡模式开机,价格低可在不执行训练时查看训练结果日志。
更多推荐


所有评论(0)