La proliferación de ASIC de IA a medida, o XPU, de parte de OpenAI, Meta, Microsoft y otros llevó a muchos a cuestionar el control de NVIDIA sobre el mercado. Después de todo, si todos están construyendo el suyo, ¿quién necesita las GPU con las que el proveedor de armas de la IA hizo su fortuna?

Pero a NVIDIA no le preocupa en absoluto y, en cambio, invitó a su competencia a saquear, o mejor dicho a licenciar, su cartera de propiedad intelectual, en particular la relacionada con redes.

¿Qué acordaron NVIDIA y MediaTek?

El lunes, MediaTek se convirtió en el más reciente en adoptar la tecnología de interconexión de alta velocidad NVLink Fusion para su incipiente oferta de XPU para centros de datos. A cambio, NVIDIA invirtió 3.500 millones de dólares en bonos convertibles emitidos por MediaTek. El gigante de las GPU también seguirá licenciando los propios diseños de la taiwanesa para usarlos en futuros sistemas DGX y RTX Spark.

MediaTek, conocida sobre todo por sus procesadores basados en Arm para teléfonos y tabletas, es apenas uno de varios diseñadores de chips de alto perfil que planean integrar la tecnología. Amazon, Fujitsu, Qualcomm, Arm y Marvell están todos en la misma lista.

NVLink Fusion comenzó como una versión comercializada de la interconexión de alta velocidad entre GPU de NVIDIA, presentada a comienzos del año pasado. Al principio se ofrecía en dos variantes: una de chip a chip para conectar CPU con GPU o XPU en un tejido coherente en memoria, y un tejido conmutado usado para coser varios aceleradores en un solo chip lógico a escala de rack. Desde entonces se expandió hasta convertirse en la oferta paraguas con la que NVIDIA licencia su propiedad intelectual de semiconductores.

Dado lo mucho que le ha costado a Broadcom y a otros desarrollar alternativas competitivas a NVLink, no sorprende que empresas como MediaTek prefieran licenciar la tecnología antes que reinventar la rueda o canalizar interconexiones alternativas, como UALink, sobre Ethernet convencional.

¿Por qué conviene licenciar en vez de construir?

Al licenciar NVLink Fusion, las empresas pueden concentrarse en construir aceleradores competitivos sin preocuparse de cómo van a escalarlos en producción.

Y como los diseños de rack MGX de NVIDIA forman parte del Open Compute Project, MediaTek y sus socios no sólo se benefician de la tecnología de red de la empresa, sino que además pueden tomar racks NVL72 existentes e insertar sus propias láminas de cómputo. Eso debería reducir de manera drástica la experiencia en diseño de sistemas e ingeniería mecánica que se necesita para pasar del silicio a un rack de IA.

Y no es teórico. Amazon está haciendo exactamente eso con su serie de aceleradores Trainium: usó el diseño de referencia MGX NVL72 de NVIDIA para sus sistemas basados en Trainium3, lanzados el año pasado. Mientras tanto, Trainium4, esperado para fines de este año, abandonará la interconexión propia NeuronLink de Amazon en favor de NVLink Fusion.

¿Qué gana NVIDIA con esto?

Bastante más que regalías de licencia. Es también una forma de mantener a las empresas enganchadas a sus otros productos.

Cuando NVLink Fusion se anunció, los clientes tenían dos opciones: emparejar sus XPU con las CPU de NVIDIA, o sus CPU con las GPU de NVIDIA. Además quedaban obligados a comprar NVSwitch si querían aprovechar las capacidades de escalamiento vertical de la tecnología.

Así, por encima de licenciar la tecnología, NVIDIA tenía el potencial de vender cerca de dos GPU por cada CPU del socio, una CPU Grace o Vera por cada dos XPU del socio, y hasta nueve NVSwitch por cada 72 aceleradores, y eso sólo dentro del rack. Si ya se está comprando NVLink, ¿por qué no usar InfiniBand o el equipamiento Ethernet Spectrum-X de NVIDIA para conmutar esos racks entre sí?

La empresa suavizó desde entonces su postura y hoy parece conforme con la combinación de ventas de NVSwitch y licencias de NVLink Fusion. De no haberlo hecho, Amazon no habría podido emparejar Graviton con Trainium.

"Lo bonito de esta plataforma es que entrega la flexibilidad y la fungibilidad para encontrar a los clientes donde están. Aprovechando la plataforma NVLink Fusion pueden adoptar desde la CPU hasta la GPU, el tejido de escalamiento vertical y la red de escalamiento horizontal a través de Spectrum-X e InfiniBand", dijo Dion Harris, director senior de infraestructura de HPC e IA a hiperescala de NVIDIA, a la prensa el lunes.

NVIDIA todavía no está lista para hablar de la estructura de licenciamiento, aunque Harris deja claro que no la van a regalar: "Es seguro asumir que habrá algunos elementos de licencia, en tanto NVIDIA NVLink Fusion es una tecnología de NVIDIA".

No se trata sólo de redes

NVIDIA ya es el mayor proveedor de redes Ethernet para centros de datos del mundo, en buena medida gracias al auge de la IA. Sus ingresos trimestrales por redes ya superan los 15.000 millones de dólares, y las licencias de NVLink Fusion junto con las ventas asociadas de NVSwitch sólo reforzarán esa cifra.

La semana pasada la empresa detalló su oferta de propiedad intelectual más reciente: NVHBM, esencialmente una base a medida con controlador de memoria integrado. Según NVIDIA, el enfoque libera 25% del área del chip para cómputo, mientras recorta el consumo de la memoria HBM en 15% y eleva el ancho de banda efectivo en 30%. Annapurna Labs, de Amazon, estará entre los primeros en desplegar la tecnología con su familia Trainium.

Conviene notar que la idea no es exclusiva de NVIDIA: tanto Broadcom como Marvell están desarrollando tecnología de troquel base similar. Pero es otro ejemplo de cómo la empresa está apalancando su músculo de ingeniería para extraer ingresos de todo lo asociado a la IA, incluidos los ASIC a medida de terceros.

¿Pacto con el diablo o coexistencia conveniente?

Aunque las ofertas de propiedad intelectual de NVIDIA son todavía estrechas, no cuesta imaginar que en poco tiempo compita en diseño de XPU con rivales como Broadcom o socios como Marvell y MediaTek. Según cómo se den las cosas, las cuatro podrían terminar pareciéndose más a enemigos amistosos.

Las XPU se están convirtiendo rápidamente en un gran negocio para Broadcom y Marvell, pero la red necesaria para escalar ese cómputo y el diseño de sistema necesario para llevarlo al mercado siguen siendo una ventaja competitiva de NVIDIA. Ambas tienen equipos de conmutación Ethernet capaces de medirse con NVSwitch, pero incluso así hay que integrarlos en un rack. La ventaja de poder insertar una lámina de cómputo a medida en un sistema NVL72 genérico y que funcione de inmediato es difícil de ignorar.

Si NVLink Fusion ayuda a los diseñadores de XPU a vender más chips, podría terminar siendo un beneficio neto incluso si eso significa perder ventas de conmutadores. NVIDIA tiene claro que, mientras la barrera de entrada al silicio a medida se desplomó, escalar ese cómputo sigue siendo la parte difícil.