NVLink Fusion es una evolución de la tecnología NVLink de NVIDIA, diseñada para crear un sistema de memoria unificada y coherente entre múltiples GPUs y CPUs (especialmente CPUs basadas en ARM de NVIDIA, como la Grace CPU). A diferencia de las interconexiones PCIe tradicionales, NVLink Fusion ofrece anchos de banda significativamente mayores y latencias mucho más bajas, facilitando la comunicación directa entre los procesadores y sus respectivas memorias. Esto elimina los cuellos de botella de transferencia de datos y permite que los procesadores accedan a la memoria de los demás como si fuera local, simplificando la programación y optimizando el rendimiento para aplicaciones de computación de alto rendimiento (HPC) e inteligencia artificial (AI).

La implementación más prominente de NVLink Fusion se encuentra en el superchip NVIDIA Grace Hopper (GH200) y en los sistemas basados en la plataforma NVIDIA Grace Blackwell. El GH200 integra una CPU Grace y una GPU Hopper en un único módulo, interconectadas mediante NVLink Fusion para compartir un espacio de memoria coherente. Esto es fundamental en supercomputadoras y clústeres de AI a gran escala, donde la capacidad de procesar enormes conjuntos de datos de manera eficiente es crítica. Otros ejemplos incluyen sistemas de servidores de alto rendimiento de fabricantes como HPE, Dell y Lenovo, que utilizan arquitecturas NVIDIA DGX o HGX para desplegar infraestructuras de AI y HPC con múltiples GPUs interconectadas a través de NVLink, y en el futuro, con NVLink Fusion para integrar CPUs.

Para un arquitecto de sistemas, NVLink Fusion es crucial porque redefine los límites de la escalabilidad y el rendimiento en cargas de trabajo intensivas en datos. Permite diseñar sistemas donde la memoria ya no es un recurso aislado por procesador, sino un pool unificado, lo que simplifica la gestión de datos y reduce la complejidad del software. Los trade-offs incluyen un mayor costo inicial y una menor flexibilidad en la elección de componentes de CPU (al estar más ligado al ecosistema NVIDIA). Sin embargo, el valor estratégico reside en la capacidad de construir sistemas con un rendimiento por vatio y por rack significativamente superior para HPC, entrenamiento de modelos de AI masivos y simulaciones complejas, donde la latencia y el ancho de banda de la memoria son factores críticos. La decisión de adoptar NVLink Fusion implica una apuesta por una arquitectura tightly-coupled que maximiza la eficiencia de la comunicación entre procesadores, a expensas de la modularidad de sistemas más loosely-coupled basados en PCIe.