La próxima ola de la inteligencia artificial está imponiendo exigencias nuevas a la infraestructura. Con los agentes de IA y las cargas de billones de parámetros volviéndose corrientes, el rendimiento ya no depende solo del cómputo, sino de cómo se diseñan en conjunto cómputo, memoria, almacenamiento, redes y software.
Con ese argumento, NVIDIA amplió NVIDIA NVLink Fusion con NVIDIA NVHBM, una tecnología de memoria de alto ancho de banda de próxima generación pensada para las XPU, es decir los aceleradores propios que cada compañía diseña. Será validada y ofrecida por los principales fabricantes de memoria, de modo que quede disponible para los clientes de NVLink Fusion.
¿Qué cambia respecto de la HBM tradicional?
Las arquitecturas HBM clásicas colocan el controlador de memoria en el troquel de la XPU, ocupando área de silicio valiosa que podría dedicarse a cómputo. NVHBM, construida sobre la misma tecnología que NVIDIA usará en sus futuras GPU, integra el controlador de memoria propio dentro del troquel base de la HBM.
Al mover el controlador a la pila 3D de HBM en vez de dejarlo en la XPU, NVIDIA declara estas ganancias frente a una HBM4E estándar:
- Hasta 30% más de ancho de banda de memoria.
- 15% menos de consumo eléctrico en la HBM.
- Hasta 25% más de área libre en el troquel de cómputo de la XPU.
Ese tercer punto es el más interesante de los tres. El área liberada no es una mejora de rendimiento en sí misma, sino espacio que el diseñador puede reasignar a unidades de cómputo, con lo que la ganancia real depende de qué haga cada socio con ese presupuesto de silicio.
¿Por qué NVIDIA estandariza la implementación?
La compañía está estableciendo una implementación estándar de NVHBM, disponible desde varios proveedores de memoria. El objetivo declarado es reducir el esfuerzo de ingeniería necesario para integrar y calificar memoria de distintos suministradores, lo que le da a los clientes de NVLink Fusion un camino más rápido para llevar sus chips de IA a medida al mercado.
En la práctica, calificar HBM de más de un proveedor es uno de los trabajos más lentos y caros del diseño de un acelerador, porque cada fabricante tiene sus propias tolerancias y procesos de validación. Una implementación común traslada ese costo desde el cliente hacia el conjunto del ecosistema.
AWS será la primera en adoptarla
Annapurna Labs, de Amazon, será la primera en trabajar con NVHBM, como parte de su colaboración más amplia con NVIDIA en torno a NVLink Fusion. La filial de chips de Amazon trabajará sobre la tecnología NVHBM y la arquitectura de escalado NVLink para mejorar rendimiento y eficiencia en cargas de inteligencia artificial.
Esto se apoya en el soporte para NVLink Fusion anunciado previamente por AWS. Annapurna Labs sostendrá NVLink Fusion con su próxima generación de chips Trainium, partiendo por Trainium4, lo que permitiría que los chips de Amazon y las GPU de NVIDIA trabajen juntos bajo una arquitectura común a escala de rack.
"NVHBM representa un enfoque arquitectónico nuevo para hacer avanzar el rendimiento y la eficiencia de la memoria de alto ancho de banda", dijo Nafea Bshara, vicepresidente de Annapurna Labs en Amazon. "Esperamos que esta colaboración tecnológica beneficie a los futuros diseños de infraestructura de AWS".
Integración vertical con la puerta abierta
NVLink Fusion permite a los socios conectar XPU y CPU a medida a la plataforma a escala de rack de NVIDIA. Esos socios acceden a los chiplets NVLink, a NVLink-C2C, a los conmutadores NVLink y a los sistemas y racks NVIDIA MGX, además de a un ecosistema amplio de fabricantes de CPU, diseñadores de ASIC, ensambladores de sistemas y proveedores de tecnología.
Como se ofrece con cada generación de la arquitectura de sistemas a escala de rack de NVIDIA, NVLink Fusion permite a los hiperescalares y a las compañías nativas de IA concentrar sus recursos de ingeniería en la innovación de la XPU, mientras usan una pila probada para redes de escalado, sistemas de rack y software. La compañía lo presenta como un camino más rápido y de menor riesgo para desplegar infraestructura de IA semipersonalizada.
Conviene leer el movimiento completo. NVIDIA está ofreciendo su tecnología de memoria e interconexión precisamente a las empresas que diseñan aceleradores para dejar de comprarle GPU. Si el chip a medida de un hiperescalar termina llevando el controlador de memoria de NVIDIA y hablando NVLink dentro de un rack MGX, la competencia ocurre en el silicio de cómputo, pero el resto del sistema sigue siendo territorio de NVIDIA.




