NVIDIA levanto el velo sobre la arquitectura de su GPU Rubin, la pieza central de la plataforma Vera Rubin que la compania posiciona como el motor de las fabricas de inteligencia: centros de datos siempre encendidos y dedicados a producir razonamiento a escala. Segun NVIDIA, la Rubin entrega hasta 10 veces mas rendimiento en cargas agenticas por unidad de energia que la generacion Blackwell.
El cambio de enfoque no es menor. Lo que empezo como entrenamiento de modelos y chats orientados a personas evoluciono hacia flujos agenticos que razonan, planifican, usan herramientas, verifican resultados intermedios y ejecutan tareas de varios pasos sobre contextos enormes. Estas cargas no se definen por un solo par de pregunta y respuesta, sino por una inferencia sostenida a lo largo de muchos pasos de razonamiento, lo que exige baja latencia por paso, alto rendimiento de decodificacion y una gran capacidad de cache KV.

¿Que hace distinta a la GPU Rubin?
La Rubin se construye a partir de dos dies de computo unidos en un solo encapsulado mediante un enlace de alta velocidad llamado NV-HBI (NVIDIA High-Bandwidth Interface). Sobre esa base, sus especificaciones marcan el ritmo:
- 336 mil millones de transistores y 224 multiprocesadores de streaming (SM).
- 896 nucleos Tensor con precision ampliada y un Transformer Engine de tercera generacion.
- Hasta 50 petaflops de rendimiento en el formato de baja precision NVFP4, preservando la exactitud.
- 288 GB de memoria HBM4 en pilas de 12 capas, con hasta 22 TB/s de ancho de banda pico.

La conectividad completa el cuadro: NVLink 6 aporta 3.600 GB/s de ancho de banda para la comunicacion todos-contra-todos entre GPU, NVLink-C2C suma 1.800 GB/s para el dialogo coherente entre CPU y GPU, y PCIe Gen 6 entrega hasta 256 GB/s hacia el host. A esto se agrega Confidential Computing con TEE-I/O para proteger los datos en reposo, en transito y en uso.
¿Como acelera la inferencia de modelos MoE?
Los modelos de mezcla de expertos (MoE) enrutan dinamicamente cada token entre muchas redes especializadas. A medida que crece el numero de expertos, mover sus pesos de forma eficiente se vuelve critico. Rubin mejora el Tensor Memory Accelerator (TMA) con actualizacion de descriptores en linea: en lugar de reescribir el descriptor en memoria, el kernel mantiene uno unificado para tensores con el mismo formato y sobrescribe campos como el puntero de memoria directamente en la instruccion, en tiempo de ejecucion.

El doble de operaciones matriciales por ciclo
Rubin duplica el rendimiento del nucleo Tensor por ciclo al duplicar los datos que procesa a lo largo de la dimension K. Una multiplicacion de matrices (GEMM) que requeria cuatro iteraciones de K en Blackwell puede completarse en solo dos en Rubin. Menos iteraciones significan menos sobrecarga de bucle y mejor utilizacion, algo clave cuando el modelo se reparte entre muchas GPU con alto paralelismo tensorial.

¿Como resuelve Rubin el contexto largo?
La atencion es uno de los caminos mas exigentes cuando las ventanas de contexto crecen. Rubin la acelera combinando esparsidad de activaciones, compresion adaptativa y un softmax mas rapido. Tras el calculo denso inicial, la GPU carga los datos intermedios en un formato comprimido esparso 2:4, lo que reduce el costo de escritura y almacenamiento sin cambiar el formato de salida que espera el resto del modelo.
El softmax, que depende de operaciones exponenciales, suele convertirse en cuello de botella cuando sube el rendimiento del nucleo Tensor. Por eso Rubin aumenta el rendimiento exponencial: 2x en FP32 y 4x en BF16/FP16 respecto de Blackwell, para que el softmax siga el ritmo de las operaciones matriciales mas veloces.

Del chip al rack: Vera Rubin NVL72
A escala de rack, la Vera Rubin NVL72 integra refrigeracion liquida, suavizado de potencia con DSX MaxLPS, una arquitectura MGX sin cables y bandejas de conmutadores NVLink intercambiables en caliente. El resultado, segun NVIDIA, permite alojar hasta un 40% mas de GPU dentro del mismo presupuesto energetico y sostener modelos de varios billones de parametros.
Especificaciones clave de la GPU Rubin
| Caracteristica | Valor |
|---|---|
| Transistores | 336 mil millones |
| Multiprocesadores (SM) | 224 |
| Nucleos Tensor | 896 |
| Memoria | 288 GB HBM4 (pilas 12-Hi) |
| Ancho de banda de memoria | 22 TB/s |
| Rendimiento NVFP4 | 50 petaflops |
| NVLink 6 (scale-up) | 3.600 GB/s |
| NVLink-C2C (CPU-GPU) | 1.800 GB/s |
| PCIe Gen 6 | 256 GB/s |
| Rendimiento agentico/energia | hasta 10x vs Blackwell |
El mensaje de fondo es que NVIDIA dejo de pensar la GPU como una unidad aislada y empezo a disenar el centro de datos completo como una sola unidad de computo, optimizada de punta a punta para la inferencia agentica.




