目录

环境准备

数据上传与管理

代码运行与调试

结果保存与下载

补充


环境准备

  • 选择合适的GPU资源

    • CPU 22 核:代表它有 22 个物理内核。这意味着它能同时高效处理 22 个大型任务,在运行高度并行的程序(如数据预处理、编译代码)时速度极快。
    • 内存110GB:  这远超普通电脑(通常 8GB-32GB)。决定了你能同时加载多少数据。在 AI 领域,大内存意味着你可以一次性读入更大的数据集,运行参数量巨大的模型不会因为内存溢出。
    • 系统盘30GB:仅安装操作系统、基础库。
    • 数据盘:存放数据集、模型权重、训练代码、日志、checkpoint。
    • GPU驱动:决定你能安装的 CUDA 版本上限。
    • CUDA版本≤ 13.0:只要 PyTorch 自带的 CUDA 版本≤ 系统驱动支持的 CUDA 版本,即可正常运行。例如,在支持 CUDA 13.0 的驱动上安装基于 CUDA 12.1 编译的 PyTorch 是完全可行且稳定的。
  • 实例创建
    • 选择镜像(PyTorch/TensorFlow等深度学习框架)

数据上传与管理

  • 创建实例后可使用JupyterLab进行操作(点击进入JupyterLab)

  • 可点击上传文件,将上传你的数据集以及代码
  • 建议将上传的文件放入autodl-tmp,因为它是数据盘,空间大。

代码运行与调试

  • 通过Jupyter Notebook执行代
  • 使用Terminal安装额外依赖库
  • 监控GPU显存和资源占用(nvidia-smi命令)
  • 如果不小心关掉终端,可在这个位置找回。

结果保存与下载

  • 将训练好的模型权重和日志,通过指令:  zip -r   输出文件名.zip   要压缩的目录  。打包为压缩文件下载

补充

在更多部分有无卡模式开机,价格低可在不执行训练时查看训练结果日志。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐