La demanda por inteligencia artificial no para de acelerar. Las cargas de trabajo son cada vez mas grandes, los modelos mas complejos y crece la presion por desplegar infraestructura de computo mas rapido que nunca. Para responder a esa demanda se estan levantando fabricas de IA, sistemas a escala de centro de datos que convierten datos y energia en inteligencia de forma continua.

Ese enfoque cambio de raiz el diseno y la operacion de los sistemas. Los FLOPS pico del acelerador ya no bastan. Las cargas actuales, que incluyen modelos de mas de un billon de parametros, arquitecturas Mixture-of-Experts (MoE), razonamiento de contexto largo y servicio desagregado, exigen que muchos aceleradores trabajen juntos como una sola unidad de computo. Eso requiere comunicacion GPU a GPU de alto ancho de banda y baja latencia.

¿Que es una red de escalado vertical y por que importa?

Conviene separar dos conceptos. Las redes de escalado horizontal (scale-out) conectan servidores a lo largo del centro de datos. Las redes de escalado vertical (scale-up) permiten que las GPUs dentro de un mismo dominio se comporten como un unico motor de computo. Ambas son esenciales, pero resuelven problemas distintos.

Las telas scale-out, como NVIDIA Quantum InfiniBand y NVIDIA Spectrum-X Ethernet, habilitan clusteres de miles a cientos de miles de GPUs. Las telas scale-up conectan aceleradores en un solo dominio con alto ancho de banda, baja latencia predecible y memoria compartida de alto ancho de banda (HBM). En el entrenamiento y la inferencia modernos, es en el dominio scale-up donde ocurren los patrones de comunicacion mas sensibles a la latencia.

Un buen ejemplo es la inferencia con modelos MoE. Para maximizar el throughput, las implementaciones eficientes usan paralelismo de expertos y distribuyen los expertos entre distintas GPUs. Eso paraleliza la carga, pero genera una comunicacion intensiva de todos contra todos: los tokens deben despacharse a los expertos seleccionados, procesarse, reunirse, reordenarse y pasarse hacia adelante. Si los expertos quedan detras de una tela de bajo ancho de banda o alta latencia, la ganancia del paralelismo se puede borrar por completo.

NVIDIA afirma haber demostrado el impacto de esta arquitectura en MoE de gran escala. Para modelos como DeepSeek-R1 y Qwen 235B, ademas de un LLM simulado de 2 billones de parametros, NVLink entrega hasta 2,3 veces mas throughput de decodificacion que el Ethernet comercial de referencia.

Figura 1. La sexta generacion de NVLink entrega hasta 2,3 veces mas throughput de decodificacion que el Ethernet comercial, en un dominio de 72 aceleradores. Resultados basados en simulacion.
Figura 1. La sexta generacion de NVLink entrega hasta 2,3 veces mas throughput de decodificacion que el Ethernet comercial, en un dominio de 72 aceleradores. Resultados basados en simulacion.

¿Cuanto ancho de banda entrega la sexta generacion?

Con Vera Rubin NVL72, la sexta generacion de NVLink provee 3,6 TB/s por GPU de ancho de banda bidireccional GPU a GPU y 260 TB/s de ancho de banda a nivel de rack en un dominio de 72 GPUs. Segun NVIDIA, la latencia de extremo a extremo para las transferencias GPU a GPU es 3 veces menor que en las alternativas basadas en Ethernet comercial, y la tasa de paquetes es 10 veces mayor.

Las bandejas de conmutadores NVLink y una espina dorsal de 5.000 cables forman una topologia unica de todos contra todos, de modo que cualquier GPU se comunica con cualquier otra con latencia y ancho de banda uniformes. Cada bandeja incluye cuatro chips conmutadores NVLink 6, 28,8 TB/s de ancho de banda total y 14,4 TFLOPS de computo en red en FP8. En un solo rack Vera Rubin NVL72, NVLink 6 provee 260 TB/s de ancho de banda agregado y 130 TFLOPS de computo en red para acelerar reducciones y otras operaciones colectivas.

La hoja de ruta de NVLink contempla dominios scale-up de hasta 1.152 GPUs y conectividad mediante optica co-empaquetada.

Figura 2. La espina NVLink de Vera Rubin NVL72, el rack y las bandejas del conmutador NVLink 6 entregan 260 TB/s de ancho de banda de todos contra todos, 3,6 TB/s por GPU y 130 TFLOPS de computo en red.
Figura 2. La espina NVLink de Vera Rubin NVL72, el rack y las bandejas del conmutador NVLink 6 entregan 260 TB/s de ancho de banda de todos contra todos, 3,6 TB/s por GPU y 130 TFLOPS de computo en red.

Cuando el software es parte de la red

El software es una pieza critica del stack e incluye NVIDIA Dynamo, NVIDIA TensorRT-LLM y la libreria de comunicaciones colectivas NCCL, todo construido sobre CUDA, la plataforma de computo paralelo que NVIDIA lanzo hace casi 20 anos.

Hardware y software se desarrollan con un enfoque de codiseno extremo, donde todo el stack, desde los chips hasta los sistemas, la tela y el software, se optimiza en conjunto. El caso mas citado por NVIDIA es la transicion de Hopper a Blackwell: al duplicar el ancho de banda de NVLink, ampliar el dominio scale-up de 8 a 72 GPUs e incorporar Dynamo para inferencia desagregada, la compania afirma haber logrado una mejora de 50 veces en el rendimiento de inferencia MoE por watt. La plataforma Vera Rubin extiende esto al duplicar de nuevo tanto el ancho de banda como el computo en red.

Mas alla de las cifras, el argumento de fondo es economico. Una red de escalado vertical bien disenada eleva el retorno de inversion al optimizar los tokens entregados por watt, por dolar y por metro cuadrado de la fabrica, con corridas de entrenamiento mas cortas, mayor utilizacion y un menor costo por token.