UALink over Ethernet es una extensión del protocolo UALink (Unified Accelerated Link) de AMD, diseñado para permitir la comunicación de alta velocidad y baja latencia entre múltiples GPUs y otros aceleradores (como FPGAs o ASICs) a través de una red Ethernet estándar. Originalmente, UALink es un protocolo propietario de interconexión punto a punto que opera a nivel de hardware, similar a NVLink de NVIDIA, optimizado para transferencias de datos directas entre dispositivos en un mismo nodo o chasis. Al extender UALink sobre Ethernet, se encapsulan las tramas UALink dentro de paquetes Ethernet, permitiendo que las capacidades de comunicación directa entre aceleradores se extiendan más allá de los límites de un único servidor, habilitando clústeres de cómputo heterogéneos y distribuidos con un rendimiento cercano al de la interconexión directa.
La implementación de UALink over Ethernet se observa principalmente en sistemas de cómputo de alto rendimiento (HPC), inteligencia artificial (AI) y machine learning (ML) que utilizan GPUs AMD Instinct. Un ejemplo concreto es su aplicación en supercomputadoras o clústeres de entrenamiento de modelos de lenguaje grandes (LLMs), donde múltiples servidores equipados con GPUs AMD Instinct necesitan compartir datos y estados de manera eficiente. Esto permite la creación de pods de GPUs distribuidos que pueden actuar como una única unidad de cómputo masiva, superando las limitaciones de ancho de banda y latencia de las interconexiones PCIe tradicionales entre nodos. Aunque es una tecnología relativamente nueva, su propósito es competir con soluciones como NVLink-over-InfiniBand o Ethernet de ultra baja latencia, ofreciendo una alternativa basada en Ethernet para la escalabilidad de cargas de trabajo intensivas en aceleradores.
Para un arquitecto de sistemas, UALink over Ethernet es crucial porque redefine las posibilidades de diseño de infraestructuras de cómputo acelerado a escala. Permite la construcción de clústeres de GPUs distribuidos con una topología de red más flexible y potencialmente más económica que las soluciones basadas en InfiniBand, al aprovechar la ubicuidad de Ethernet. El trade-off principal radica en equilibrar la latencia y el ancho de banda que puede ofrecer una red Ethernet optimizada (ej. RoCEv2 con RDMA) frente a la interconexión directa o InfiniBand. La decisión de adoptarlo implica evaluar el costo total de propiedad (TCO), la complejidad de la gestión de red, la compatibilidad con el ecosistema de software (ej. ROCm de AMD) y los requisitos específicos de rendimiento para cargas de trabajo de AI/HPC. Su valor estratégico reside en democratizar el acceso a interconexiones de alto rendimiento para aceleradores, facilitando la escalabilidad horizontal de infraestructuras de IA sin comprometer drásticamente el rendimiento de la comunicación entre GPUs.