La creciente demanda de cómputo para modelos de IA a gran escala ha impulsado la necesidad de arquitecturas de aceleradores que no solo maximicen el rendimiento por unidad, sino que también optimicen la comunicación y la coherencia de datos a través de múltiples unidades. El problema fundamental que aborda la MI455X es cómo escalar eficientemente la capacidad de procesamiento y la memoria de una GPU individual a un sistema de rack completo, minimizando los cuellos de botella de interconexión y la latencia de acceso a datos.

Históricamente, la evolución de las arquitecturas de GPU ha pasado de unidades de cómputo genéricas a diseños altamente especializados para cargas de trabajo paralelas. Con la MI455X, AMD transiciona de la microarquitectura GCN a una basada en RDNA, adaptando los principios de procesamiento de gráficos a las exigencias de la IA, donde la eficiencia en operaciones de matriz y la gestión de grandes conjuntos de datos son críticas. La integración de una red de baja latencia y alta capacidad dentro del rack es tan crucial como las mejoras en la propia GPU para lograr un rendimiento escalable.

Arquitectura del Sistema

La MI455X se basa en la arquitectura CDNA5, que reorganiza las unidades de cómputo en Work Group Processors (WGPs) en lugar de Compute Units (CUs). Cada WGP contiene cuatro unidades SIMD32 de doble emisión y cuatro unidades escalares, un cambio significativo respecto a CDNA4. Esto permite hasta 256 operaciones FP32 empaquetadas por ciclo por WGP. Las unidades de matriz han sido mejoradas para operaciones FP4 y FP8, con hasta 65,536 operaciones de matriz por ciclo por WGP.

El subsistema de memoria incluye 12 stacks de HBM4, totalizando 432 GB de memoria con un ancho de banda de 23.3 TB/s. El SoC incorpora dos Fabric Cache Dies (FCDs) con un L2 global de 192 MB, proporcionando hasta 54 TB/s de ancho de banda L2 agregado. Una característica clave es la introducción de cargas multicast, que permiten a múltiples WGPs acceder a la misma porción de datos (ej. un operando 'A' en una GEMM) con una sola instrucción de carga, reduciendo el tráfico redundante en L2 y los enlaces chiplet. El 'Broadcast Arbitrator' a nivel de Shader Engine facilita esta amplificación de ancho de banda local.

Para la escala de rack, el sistema Helios utiliza una arquitectura de red tolerante a fallos basada en UALink over Ethernet (UAEoL). Cada MI455X tiene 36 interfaces UALoE de 400 Gbit/s, proporcionando 3.6 TB/s de ancho de banda bidireccional por GPU. Se emplea una arquitectura DMA dividida para optimizar el tráfico de red. El rack Helios puede albergar 72 GPUs, interconectadas con 12 switches que ofrecen 432 enlaces a 200Gb/s cada uno, logrando un ancho de banda bidireccional de escala-up de 260 TB/s. La conectividad CPU-GPU se realiza a través de AMD Infinity Fabric, reemplazando PCIe, para una coherencia de memoria entre el host y el acelerador.

Flujo de Carga Multicast en MI455X

  1. 1 Host CPU Inicia una operación de cómputo que requiere datos comunes para múltiples WGPs.
  2. 2 GPU Memory Controller Recibe la solicitud de carga de datos comunes (ej. operando 'A').
  3. 3 L2 Cache Los datos se cargan una vez desde HBM4 a la caché L2 global.
  4. 4 Broadcast Arbitrator Recibe los datos de L2 y los replica a múltiples Shader Engines.
  5. 5 LDS (Local Data Share) Cada WGP relevante recibe una copia local de los datos en su LDS.
  6. 6 WGPs Ejecutan operaciones de matriz utilizando los datos comunes y sus datos espec...

Flujo de Comunicación en Rack Helios

  1. 1 MI455X GPU Inicia comunicación con otra GPU en el mismo rack.
  2. 2 IO Die (FCD) Gestiona la salida de datos a través de interfaces UALoE.
  3. 3 UALoE Interface Envía datos a través de enlaces Ethernet de 200Gb/s.
  4. 4 Helios Switch Tray Uno de los 12 switches interconecta las GPUs.
  5. 5 UALoE Interface Recibe datos en la GPU de destino.
  6. 6 IO Die (FCD) Procesa los datos entrantes.
  7. 7 MI455X GPU Recibe los datos para su procesamiento.
CapaTecnologíaJustificación
compute AMD Instinct MI455X (CDNA5) Acelerador principal para cargas de trabajo de IA, proporcionando cómputo de matriz y vector de alto rendimiento. vs NVIDIA H100/H200 (Hopper), Intel Gaudi3 256 WGPs, 432 GB HBM4, 40.26 PFLOP (OCP MXFP4)
networking UALink over Ethernet (UAEoL) Proporciona interconexión de alta velocidad y baja latencia entre GPUs dentro del rack, habilitando comunicación all-to-all de un solo salto. vs InfiniBand, Ethernet estándar con RoCE 36 x 400Gbit/s interfaces por GPU, 3.6 TB/s bidireccional por GPU
networking AMD Infinity Fabric Enlace coherente de alta velocidad entre la GPU y la CPU host, reemplazando PCIe para mejorar el ancho de banda y la coherencia de memoria. vs PCIe Gen5/Gen6, NVLink 16 lanes, 256 GB/s de ancho de banda bidireccional
storage HBM4 Memoria de alto ancho de banda para la GPU, crítica para alimentar las unidades de cómputo con datos a la velocidad requerida por los modelos de IA. vs GDDR6, DDR5 12 stacks, 432 GB por GPU, 23.3 TB/s de ancho de banda
compute AMD EPYC 9006 SP7 CPU host para el rack Helios, gestionando las GPUs y proporcionando recursos de cómputo y memoria adicionales. vs Intel Xeon Scalable, ARM-based servers 96 cores, 1TB de memoria por CPU

Trade-offs

Ganancias
  • Rendimiento FP4/FP8
  • Ancho de banda de memoria efectiva (multicast)
  • ▲▲ Escalabilidad de rack (número de GPUs)
  • Ancho de banda de interconexión intra-rack
Costes
  • Complejidad de diseño de microarquitectura (transición GCN a RDNA)
  • Consumo de energía (implícito en la escala)

Fundamentos Teóricos

La optimización de la comunicación de datos en arquitecturas paralelas, especialmente para operaciones de matriz densas como las utilizadas en el entrenamiento de redes neuronales, se relaciona con principios fundamentales de la computación paralela y distribuida. El concepto de cargas multicast y la amplificación de ancho de banda local en el Broadcast Arbitrator tienen raíces en técnicas de optimización de caché y memoria compartida en sistemas multiprocesador. La reducción del tráfico redundante de memoria es un objetivo central en el diseño de jerarquías de memoria eficientes, como se discute en trabajos sobre coherencia de caché y modelos de memoria compartida.

La arquitectura de red all-to-all de un solo salto en el rack Helios se alinea con los principios de diseño de redes de interconexión de alto rendimiento para supercomputadoras, donde la latencia y el ancho de banda son críticos. Conceptos como las redes de fat-tree o toroidales, estudiadas en la década de 1980 y 1990 (ej. 'Fat-trees: universal networks for hardware-efficient supercomputing' de Leiserson, 1985), buscan minimizar los saltos y maximizar el rendimiento agregado. La transición de PCIe a Infinity Fabric para la coherencia CPU-GPU refleja la evolución hacia modelos de memoria más unificados, un tema recurrente en la investigación de arquitecturas heterogéneas.