AMD MI455X AI 加速卡

早在年初 CES 2026,AMD 就对外公布了 MI455X 这款新一代顶级 AI 加速芯片的存在。伴随近期 Advancing AI 2026 峰会的召开,MI455X 迎来全面正式发布,所有硬件参数、架构细节、配套 Helios 整机方案全部公之于众。作为全球首款量产级 2nm GPU,依托全新 CDNA-5 架构重构 AI 计算单元与数据通路。从数月前的概念官宣到如今完整规格落地,MI455X 的登场不仅是 AMD 算力产品的一次跨越式升级,也改写了当下 AI 芯片的竞争格局。
在 GPU 硬件层面,MI455X 集成 3200 亿晶体管,由 2x FCD (Fabric and Cache Die) + 2x IO Die + 8x XCD (Accelerator Complex Die) + 12x HBM4 组成,其中 XCD 为台积电 2nm 工艺,其余 FCD 和 IO Die 是台积电 3nm 工艺。
其 IO Die 分别集成了用于 CPU 与 GPU 间互联、GPU 间 Scale Up 互联、机柜 Rack 间互联 等通信能力 IP,具体的通信架构和通信速率打算在下一篇机柜分析篇中呈现,
本文更注重单卡计算和访存层面的解读。

极致算力

MI455X 全面升级为第五代 CDNA 架构,计算单元从原有的 CU (Compute Unit) 变更为新的 WGP (Work Group Processor)。支持 Wave32 执行模式,每个 WGP 包含 4 个双发射 Wave32 SIMD32 单元,减少同步开销、提升 SIMD 利用率。
对比以往 CDNA 架构,当前架构下,WGP 每时钟周期可计算 FP32 数达 256 个,FP4 达 65536 个。
那么基于 MI455X 中所包含的 8 个 XCD,共计 256 个 WGP,最大计算时钟频率为 2.4 GHz,这使其峰值算力表现为:
  • matrix/vector FP32 算力最高约达 315 TFLOP
  • OCP MXFP4 算力最高约达 40.26 PFLOP

高效访存

MI455X 这次给的独立显存容量非常足,432GB 直接冲击业界顶流,共由 12 组每组 36GB HBM4 构成。
得益于 HBM4 高规格,其单 Port 位宽为 2048 bits,比 HBM3E 的 1024 bit 位宽多出一倍。此外,其单 pin 脚传输速率可达 7.6 GT/s,AMD 对外宣称单卡峰值带宽可达 23.3 TB/s。
实际上带宽根据所提供的数据也能够计算得得出,印证其宣称准确:
那么总的来说,MI455X 相对上一代 MI355X,其显存容量提升 0.5 倍,显存带宽提升近 2 倍,单卡性能提升显著。
这样的内存配置在业界是什么地位?来看一下与老大哥 NV 最新产品 Rubin 的配置对比,
可见在内存容量与带宽吞吐方面,也是超越般的存在。AMD 可以的,期望继续突破!
另外一项访存相关优化,MI455X 于 WGP Engine 层级设置广播仲裁器替代掉 MI355 搭载的 L1 缓存,其可执行写合并。另外能够依托多播加载,计算过程中仅需一次从 L2 读取共用矩阵源数据,再分发至各个运算单元本地 SRAM,从而减少冗余读写与芯粒通信,提高整体计算效率。
除常规性能提升外,MI455X 同时还支持显存 NUMA 模式,可以为不同使用场景的算子提供更高的访存性能,避免跨 Die 访问延迟,从而为 Die 内的计算单元提供最为极致性能的内存载体。
其次,MI455X 也支持算力切分模式,实现硬件级虚拟化,可以同时跑多个独立任务,提高硬件使用率。适合多租户服务器、云上 AI 实例,给到不同客户独立的硬件资源。

效能提升

MI455X 还引入多个优化细节,如公开资料所示,其增加了异步数据搬移 IP、数据预取、更加细化的同步原语、更实时的指令分发/调度处理器等,
总的来说,AMD 本次架构优化的核心并非一味堆砌理论峰值算力,而是从数据传输、集群通信、线程同步、任务调度四个维度优化,降低内存流量、提高硬件利用率,从而呈现出更佳的运转性能。
参考资料:
https://videocardz.com/newz/amd-instinct-mi455x-gpu-features-432gb-hbm4-and-23-3-tb-s-memory-bandwidth https://www.amd.com/content/dam/amd/en/documents/products/technologies/cdna/amd-cdna5-whitepaper.pdf

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注