AMD-Helios AI 计算柜

在各公司的 AI 训推机房中,单卡的能力简直是沧海一粟,离实际生产环境的所需要求相差甚远,所以不得不将千卡、万卡组建到一起,搭建起承载千亿、万亿参数模型的运转。
本文将围绕 MI455X 互联解决方案,从单节点 Helios 机柜逐步展开。

机柜架构

Helios 是 AMD 面向前沿大模型训练、海量推理、智能 Agent 负载推出的机架级一体化 AI 整机柜解决方案。整机柜可将 72 张 Instinct MI455X GPU 融合为单一统一计算域,对标封闭 NVL72 架构,全程基于 OCP、UALink 开放以太网标准。
整机内部硬件采用上下计算区、中间交换区的对称分层排布。上下分区各 9 个总共 18 计算托盘,每个托盘集成 4 张 MI455X GPU + 1 颗 EPYC CPU。中间共 6 个交换托盘。
整机 72 卡共享统一内存与通信域,整机峰值算力、带宽指标:
  • AI 峰值算力:MXFP4 精度最高 2.9 ExaFLOPS,MXFP8 精度 1.4 ExaFLOPS;
  • 统一显存池:72 张 GPU 合计 31TB HBM4 高速显存;
  • 全局内存总带宽:1.7 PB/s;
  • 机架内纵向扩展(Scale Up)总带宽:双向 260 TB/s;
  • 机架间横向扩展(Scale Out)总带宽:双向 43 TB/s;

托盘架构

计算托盘是 Helios 算力承载核心,单托盘包含算力、内存、网络等模块,全部集成于一体。
计算托盘内包含三大核心硬件:
  • Instinct MI455X GPU:基于新一代 CDNA‑5 架构,搭载大容量 HBM4、超高显存带宽,AI 算力强悍,适配前沿大模型训练、分布式推理。
  • 第 6 代 EPYC 主机 CPU:负责主控调度,具备多核、高内存带宽与企业级稳定性,保障机架级算力输出。
  • Pensando AI 网卡:软硬件可编程,支持 UEC (Unified Ethernet Cluster) RDMA、高性能以太网;流量管控、拥塞优化,实现高吞吐跨机架大规模 AI 组网。

卡间互联

Helios 整套互联架构分为 Scale-Up(机架内纵向扩展,UALoE)与 Scale-Out(机架间横向扩展,UALink/RDMA 以太网)两套独立高速网络,搭配 CPU-GPU Infinity Fabric 一致性互联,三层链路协同支撑全场景扩展。

CPU-GPU 一致性互联

每张 MI455X 通过专属 AMD Infinity Fabric 直连 CPU,双向带宽 256GB/s,支持 CPU 缓存一致性访问 GPU 显存,优化 KV 缓存、数据预处理、多模态混合负载数据共享效率,降低传统 PCIe 直连的数据拷贝开销。

UALoE 纵向扩展网络(机架内 72 GPU 互联)

每张 MI455X 引出 36 条 400G UALoE 链路,通过托盘背部盲插铜缆直连机柜中间交换托盘,负责机柜内 GPU 之间共享内存、参数同步、MoE 专家路由通信等。

UALink 横向扩展网络(机架间集群互联)

托盘搭载 2 组定制网卡子板,集成多块 AMD Pensando Vulcano 800 AI-NIC;单 GPU 最多可挂载 3 张 800G AI 网卡,单卡双向横向扩展带宽 600GB/s,整机柜对外聚合 43TB/s 集群带宽,基于标准 RDMA 以太网实现多机柜 AI 集群横向扩容。
最后想说下,在 Helios 面世之前,顶级万亿参数训练集群只能优先采购英伟达机柜。现在 Anthropic、微软 Azure、Meta 等头部企业已经开启大规模部署 AMD 算力,估计大型 AI 企业都会搭建多条独立算力供应链,规避供货紧张、定价捆绑、芯片出口管制带来的供应链风险,单一厂商把持高端算力的局面可能不复存在。

参考资料:

https://www.amd.com/content/dam/amd/en/documents/products/technologies/cdna/amd-cdna5-whitepaper.pdf

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注