第一步:硬件兼容性与系统环境核查

在动手安装任何软件之前,最容易被忽视却最关键的一步是确认你的“地基”是否稳固。ROCm 对底层硬件和操作系统版本有着明确的依赖关系,盲目安装往往会导致驱动无法加载或设备不可见。

首先,我们需要确认操作系统环境。目前 ROCm 在 Ubuntu 22.04 LTSUbuntu 24.04 LTS 上的支持最为完善。如果你使用的是较旧的 20.04 版本,建议升级内核至 6.x 系列以获得更好的新硬件支持;若使用 RHEL 或 SLES 等发行版,请确保已开启额外的存储库(EPEL/HTP)。可以通过 uname -r 检查内核版本,通常建议保持在 6.5 以上以适配最新的 GPU 特性。

接下来是重头戏:硬件兼容性确认。AMD 的 GPU 产品线庞大,但并非所有显卡都能完美运行最新的 ROCm 7.x 栈。对于追求极致算力的数据中心用户,AMD Instinct MI300 系列(包括 MI300X 和 MI300A)是原生支持的首选,它们针对 AI 训练和推理进行了深度优化,能够满血释放 FP8/FP16 性能。

对于广大开发者和爱好者手中的消费级显卡,情况则稍显复杂。Radeon RX 7900 XTX/XT(Navi 31 核心)以及 RX 7800/7700 系列在 ROCm 6.x 之后获得了较好的支持,但在 7.x 版本中可能需要通过设置环境变量 HSA_OVERRIDE_GFX_VERSION 来欺骗驱动识别架构版本。值得注意的是,最新的 Strix Halo 架构(集成高性能 RDNA 核心)也开始进入 ROCm 的支持视野,这为移动端和紧凑型工作站带来了本地运行大模型的可能。如果你的显卡不在官方明确支持的列表中,不要急着放弃,社区常有非官方的补丁或变通方案,但在本教程中,我们优先保证在官方支持列表内的硬件上跑通流程,以确保稳定性。

第二步:添加软件源与核心组件安装

确认环境无误后,我们正式进入安装环节。为了避免依赖冲突,强烈建议通过 AMD 官方 APT 源进行安装,而不是直接使用 Ubuntu 自带仓库中的旧版包。

打开终端,首先导入 AMD 的 GPG 密钥并添加软件源。这一步是建立信任链的关键:

wget -q -O - https://repo.radeon.com/rocm/rocm.gpg.key | sudo apt-key add -
echo 'deb [arch=amd64] https://repo.radeon.com/rocm/apt/debian/ ubuntu main' | sudo tee /etc/apt/sources.list.d/rocm.list

添加完成后,更新本地的包索引:

sudo apt update

接下来安装核心开发套件。对于大多数开发者而言,rocm-hip-sdk 是最小必要集,它包含了 HIP 运行时、编译器以及基础的数学库。如果你需要更完整的工具链(包括调试器和性能分析器),可以安装 rocm-dev,但为了保持环境轻量,我们先聚焦于核心组件:

sudo apt install rocm-hip-sdk rocblas hipblas

安装过程可能会下载数百兆甚至数吉字节的数据,请耐心等待。安装完成后,有一个极易被忽略但致命的步骤:用户权限配置。默认情况下,普通用户没有权限直接访问 /dev/kfd/dev/dri 设备节点,这会导致后续程序报错"Permission denied"或直接识别不到 GPU。

你需要将当前用户添加到 rendervideo 用户组中:

sudo usermod -a -G render $USER
sudo usermod -a -G video $USER

执行完上述命令后,必须重启系统或者注销并重新登录,使组权限生效。这是很多新手卡在"No device found"问题的根本原因。重启后,我们可以通过简单的命令初步验证驱动模块是否加载:lsmod | grep amdgpu,如果有输出,说明内核驱动已正常工作。

第三步:运行示例验证与 PyTorch 快速推理

系统重启归来,现在是见证成果的时刻。我们不需要立刻编写复杂的 AI 代码,而是先利用 ROCm 自带的示例程序来验证整个工具链是否闭环。

ROCm 安装后会在 /opt/rocm 目录下放置一系列测试样本。我们进入向量加法示例目录,这是一个经典的并行计算"Hello World":

cd /opt/rocm/share/hip/samples/0_Intro/vector_add
make
./vector_add

如果编译顺利且运行后输出了类似 PASSED 的结果,恭喜你,HIP 编译器和工作流已经打通。接着,我们用更底层的工具 rocminfo 来查看 GPU 的详细拓扑信息:

rocminfo | grep -A 5 "Name.*amd"

如果能看到你的显卡型号(如 gfx942 对应 MI300,或 gfx1100 对应 RX 7900)以及详细的内存大小信息,说明运行时层已完美识别硬件。

最后,我们来点实际的——部署一个最简单的 AI 推理环境。目前 PyTorch 对 ROCm 的支持最为成熟。你可以直接通过 pip 安装预编译好的 ROCm 版本(注意版本号需与你安装的 ROCm 版本匹配,例如 ROCm 6.2 对应 torch 2.4+):

pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/rocm6.2

安装完成后,启动 Python 交互界面进行验证:

import torch
print(f"PyTorch 版本:{torch.__version__}")
print(f"ROCm 可用:{torch.cuda.is_available()}") # 在 ROCm 中 torch.cuda 依然作为后端接口
if torch.cuda.is_available():
    print(f"当前设备:{torch.cuda.get_device_name(0)}")
    # 简单张量测试
    x = torch.rand(5, 3).cuda()
    y = torch.rand(5, 3).cuda()
    print("矩阵乘法测试结果:", torch.mm(x, y.t()))

一旦看到张量运算成功输出,意味着你已经具备了运行 LLaMA-FactoryvLLM 等高级框架的基础能力。此时,你可以尝试克隆 TileLang 项目来探索更高效的算子融合,或者直接在 GitHub 上寻找支持 ROCm 的开源大模型项目进行微调。从此刻起,你的 AMD GPU 不再只是图形渲染的工具,而是一台真正的 AI 加速引擎。

200小时GPU算力已就位,快来领取:https://marketing.csdn.net/questions/Q2604140858304426315?utm_source=AIpaper

在这里插入图片描述

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐