NVIDIA comenzó la producción a gran escala de Vera Rubin, su nueva plataforma de centros de datos para inteligencia artificial, con los primeros racks ya operando en CoreWeave, Google Cloud, Microsoft Azure y Oracle Cloud Infrastructure. Según la compañía, la cadena de suministro abarca más de 350 plantas en 30 países, la más grande jamás montada para un sistema a escala de rack.

La plataforma Vera Rubin NVL72 está diseñada "del chip a la red eléctrica" para entregar el mayor rendimiento por vatio y el menor costo por token. El primer benchmark de CoreWeave, ejecutado sobre el modelo DeepSeek-R1, mostró 10 veces más rendimiento por megavatio que la generación anterior Grace Blackwell NVL72, la métrica que más importa para las fábricas de IA limitadas por energía.

¿Qué hace distinta a Vera Rubin?

La clave es lo que NVIDIA llama codiseño extremo: siete chips y cinco bandejas de rack fueron concebidos como un único sistema, no ensamblados a partir de componentes sueltos.

En el centro está la CPU Vera, con un núcleo propio llamado Olympus. NVIDIA afirma que entrega el doble de rendimiento en un solo hilo, el triple de ancho de banda entre núcleos y 40% menos latencia de memoria frente a los diseños de chiplets de la competencia, algo pensado para las cargas de agentes de IA.

Redes y refrigeración: los cuellos de botella ocultos

En conectividad, la sexta generación de NVLink ofrece más del doble de rendimiento en cargas complejas, un tercio de la latencia y diez veces más tasa de paquetes que Ethernet estándar. Para escalar hacia afuera, Spectrum-X Ethernet combina switches Spectrum-6 de 102,4 Tb/s y SuperNICs ConnectX-9 de 1,6 Tb/s. Empresas como CoreWeave, Microsoft, SpaceXAI y Tesla están entre las primeras en adoptar los switches Spectrum-6.

El diseño mecánico también cambió. Tres generaciones de codiseño produjeron un sistema sin cables, ventiladores ni mangueras en la bandeja, lo que redujo el tiempo de ensamblaje de horas a un minuto. Además, una temperatura de entrada de refrigeración líquida de 45 grados Celsius permite operar sin enfriadores mecánicos y ahorra millones de galones de agua por megavatio al año.

Rack Vera Rubin NVL72 desplegado en CoreWeave
Rack Vera Rubin NVL72 desplegado en CoreWeave

Europa y la IA soberana

Vera Rubin es también la base de una alianza ampliada entre Microsoft y Mistral para llevar IA de frontera a Europa bajo control regional. El acuerdo, de varios miles de millones de dólares, suma miles de GPU Vera Rubin a la capacidad de Mistral para entrenamiento, inferencia y despliegue a gran escala. Los modelos Mistral Medium 3.5 y OCR 4 ya están disponibles en Microsoft Foundry.

Comparado con el sistema GB200 NVL72, NVIDIA sostiene que Vera Rubin NVL72 entrega hasta 10 veces más tokens por megavatio y un décimo del costo por millón de tokens, un punto crítico cuando los sistemas de agentes pueden consumir hasta 15 veces más tokens que las aplicaciones de IA tradicionales.

Primeros despliegues comerciales

CoreWeave fue la primera nube en validar Vera Rubin NVL72 y ya comparte cifras medidas en hardware real. Su fabric NVLink 6 de 260 TB/s todo a todo permite que el rack se comporte como un solo acelerador unificado, algo decisivo para la arquitectura de expertos (MoE) de DeepSeek-R1.

En paralelo, Google Cloud estrenó su instancia A5X, basada en Vera Rubin NVL72, con la startup londinense Ineffable Intelligence como primer cliente. La empresa desarrolla sistemas "superlearner" que aprenden por experiencia mediante aprendizaje por refuerzo en entornos simulados masivamente paralelos.

"La próxima era de la investigación requiere la próxima era de hardware", dijo Lasse Espeholt, cofundador de Ineffable Intelligence, quien destacó que pudieron empezar a operar casi de inmediato.