近日,AMD 正式发布 AMD ROCm 10,标志着 AMD 软件栈迈入第十个年头,同时 ROCm.AI 正式面向用户开放(GA)。ROCm.AI 首次于 Advancing AI 2026 上亮相,是一套 AI 原生软件体验,旨在提升 AMD 硬件上的 AI 开发效率与性能优化能力。

ROCm.AI 汇聚了三大核心开发体验:AMD Skills、ROCm CLI 和 AMD Hyperloom。三者协同,将 AMD 的专业能力和 Agentic 工作流融入开发者现有的工具体系,让创新能够以 AI 演进的速度持续推进。
通过对 Kernel、内存管理和调度进行 AI 驱动的优化,在相同硬件上,采用 ROCm.AI 配置的系统相比 ROCm 7,推理性能平均提升 3.3 倍,训练性能平均提升 2.4 倍。
AMD AI 开发者全新体验
ROCm.AI 覆盖 AI 开发流程的三个关键环节,为开发者提供支持:优化推理性能、借助 AMD 专业能力进行开发,以及运行 AI 工作负载。
使用 AMD ROCm Hyperloom 实现端到端推理优化
作为 ROCm.AI 的核心组件之一,ROCm Hyperloom 是一套自主 Agentic 系统,能够针对 Host 代码和 GPU Kernel,对端到端推理工作负载进行优化。
Hyperloom 可对工作负载进行性能分析,识别瓶颈,探索优化方案,实施针对性的代码调整,并通过基准测试评估优化效果,最终验证性能和运行正确性。

在 ROCm 10 中,Hyperloom 进一步扩展了对 AMD Instinct GPU 的支持,并兼容 vLLM 和 SGLang。开发者可以针对 HIP、Triton 和 FlyDSL 开展优化,Hyperloom 将生成优化报告,详细说明建议的代码修改方案,以及实测或预期的性能提升。
Hyperloom 支持独立工作流和 AMD Skills 两种使用方式,为开发者提供多种选择,可将 Agentic 优化能力融入现有的开发流程。
借助 AMD 专业能力进行开发
AMD Skills 将经过整理的 AMD 专业知识和经过验证的工作流程融入 Claude Code、Cursor 和 Codex 等受支持的 AI 编程 Agent,为开发者提供针对 AMD 平台的专业指导,同时无需改变现有的开发工具和工作方式。
随着 ROCm 10 的发布,AMD Skills 目录进一步扩展至三大领域:
l 客户端原生工作流:面向本地 AI 和应用集成场景。
l 跨栈工作流:涵盖诊断、路由、回放分析和性能优化等任务。
l 服务器原生工作流:面向 AMD Instinct GPU 和 AMD EPYC处理器,涵盖服务部署、性能分析和性能评估等场景。

开发者不需要更换现有工具,就能获得针对 AMD 平台的专业指导
在 Advancing AI 大会上预览的 Skills 现已通过 Claude Code、Codex 和 Cursor 的 Marketplace 正式上线,同时也可通过 GitHub 上的开放目录获取。每项正式发布的 Skill 都会在上线前经过结构和行为测试,以帮助提供一致、可靠的工作流程。
更简单的工作流程
ROCm CLI 是 ROCm.AI 中的技术预览组件,提供稳定、统一的命令行界面,用于在 AMD 硬件上设置、管理和运行 AI 工作负载。
开发者可以通过手动操作、AI 编程代理或持续集成(CI)环境,使用相同的工作流程。通过这一统一界面,开发者可以检查系统、安装和管理 ROCm 环境、部署模型服务、运行诊断、更新组件以及控制运行时。

ROCm CLI 是面向 AMD 硬件 AI 工作负载的统一命令行界面。
该 CLI 可在 Windows 和 Linux 上以预编译二进制文件形式运行,无需预先安装 ROCm。它支持托管式 ROCm 环境,可同时管理多个不同版本的运行时,并支持运行时激活与回滚,同时集成模型服务和推理引擎管理功能。
目前,适配器支持在部分 AMD 客户端系统上使用 Lemonade,以及通过 vLLM 在 AMD Instinct GPU 上提供模型服务。
CLI 内置的 ROCm Console(原名“dash”)可实时呈现系统状态和工作负载活动。开发者可以监控 ROCm 运行时健康状况、模型服务、GPU 利用率以及基准测试遥测数据。在支持的 AMD Instinct 系统上,还可查看高带宽内存(HBM)使用量、功耗和每瓦每秒生成的 Token 数(tokens per watt)等指标。
作为 Technology Preview(技术预览版),ROCm CLI 可跨不同 ROCm 版本提供与具体版本无关的使用体验,目前从 ROCm 7.13 软件版本开始支持,ROCm 10 的正式支持即将推出。
基于 ROCm 10 软件栈构建
这些开发者体验建立在更广泛的 ROCm 10 软件栈之上,其中包括 ROCm Core SDK,为在 AMD 平台上构建和运行 AI 工作负载提供更加模块化的基础。
ROCm 10 还带来了对库、编译器、框架、工具、模型支持、性能以及硬件平台等方面的更新。
如需深入了解 ROCm Core SDK,包括其库、编译器、工具、框架和模型支持、性能提升以及平台更新,请阅读完整的 ROCm 10 技术深度解析。
(MI350-81) 推理性能
AMD Performance Labs 于 2026 年 7 月 7 日进行测试,比较搭载 8 张 AMD Instinct MI355X GPU 的系统在 AMD ROCm 7.0 软件与预览版 **AMD ROCm.ai(ROCm 7.2.2)**下的推理性能,以每秒生成 Token 数(TPS)衡量。
ROCm.ai 预览版采用了包括**优化内核(Optimized Kernels)、并行化(Parallelism)和调度(Scheduling)**在内的优化方案。测试使用 GLM-5、Kimi-K2.5 和 DeepSeek-R1-0528 三个模型。
文中所述的性能提升,为上述 3 个测试模型的 TPS 综合平均提升幅度。
硬件配置
Supermicro AS-4126GS-NMR-LCC(H14DSG-OD 主板)
8× AMD Instinct MI355X
BIOS:AMI v1.4a(2025-04-16)
GPU 固件:SMC 04.86.11.02
TA RAS:27.69.00.10
TA XGMI:32.00.00.20
RLC 43 / MEC 36 / SDMA 12
Ubuntu 22.04.2 LTS
Kernel 5.15.0-70-generic
amdgpu Driver 6.16.6
Host ROCm 7.1.0
软件配置
ROCm 7.0:
GLM-5:rocm/sgl-dev:v0.5.8.post1-rocm700-mi35x-20260219,PyTorch 2.8.0,SGLang v0.5.8
Kimi:vllm/vllm-openai-rocm:v0.16.0,vLLM 0.16.0
DeepSeek-R1:rocm/7.0:…sgl-dev-v0.5.2-rocm7.0-mi35x-20250915,SGLang v0.5.13
ROCm.ai 预览版(ROCm 7.2.2):
GLM-5:rocm/atom:rocm7.2.2_ubuntu24.04_py3.12_pytorch_release_2.10.0_atom0.1.2.post,ATOM v0.1.2.post
Kimi:vllm/vllm-openai-rocm:v0.22.0,vLLM v0.22.0
DeepSeek-R1:lmsysorg/sglang-rocm:v0.5.13-rocm720-mi35x-20260612,SGLang v0.5.13
不同服务器厂商的硬件配置可能有所不同,因此测试结果也可能存在差异。实际性能还可能受到系统配置、软件、vLLM 版本、驱动程序以及最新优化方案等因素影响。
(MI350-82) 训练性能
AMD Performance Labs 于 2026 年 7 月 7 日进行测试,对比 AMD ROCm 7.0 软件与预览版 **AMD ROCm.ai(ROCm 7.2.2)**的训练性能,以每秒生成 Token 数(TPS)衡量。
测试基于搭载 8 张 AMD Instinct MI355X GPU 的系统,并使用 Megatron-LM 运行 DeepSeek-V2-Lite、DeepSeek-V3-16B 和 Qwen3-30B-A3B 三个模型。
文中所述的性能提升,为上述 3 个测试模型的 TPS 综合平均提升幅度。
硬件配置
Supermicro AS-4126GS-NMR-LCC(H14DSG-OD 主板)
8× AMD Instinct MI355X
BIOS:AMI v1.4a(2025-04-16)
GPU 固件:SMC 04.86.11.02
TA RAS:27.69.00.10
TA XGMI:32.00.00.20
RLC 43 / MEC 36 / SDMA 12
Ubuntu 22.04.2 LTS
Kernel 5.15.0-70-generic
amdgpu Driver 6.16.6
Host ROCm 7.1.0
软件配置
DeepSeek-V2-Lite:ROCm 7.2.1 + Primus v26.3
DeepSeek-V3-16B:ROCm 7.2.1 + Primus v26.3
Qwen3-30B-A3B:ROCm 7.2.1 + Primus v26.3
不同服务器厂商的硬件配置可能有所不同,因此测试结果也可能存在差异。实际性能还可能受到系统配置、软件以及最新驱动和优化方案等因素影响。
