Si vas a construir un acelerador de IA a medida, la inferencia es un buen punto de partida. Los clústeres son más chicos, los chips pueden ser más simples y, al final del día, solo tienen que hacer una cosa: entregar tokens. Los nuevos chips Jalapeño de OpenAI son apenas el ejemplo más reciente.

Meta va a contracorriente. Su primer acelerador generativo de verdad, el MTIA 400 (sigla de Meta Training and Inference Accelerator), apunta derecho al entrenamiento de modelos de lenguaje.

La matriz de Facebook no es nueva en el silicio propio. Pero, igual que Amazon y Google, sus primeros aceleradores de IA no nacieron para correr chatbots ni para entrenar modelos generativos: nacieron para servir publicidad.

El MTIA 400, anticipado a comienzos de año y detallado esta semana en la conferencia anual Hot Chips, también hará tareas de inferencia. Pero no del tipo generativo: cargará con los sistemas de recomendación de avisos que efectivamente pagan las cuentas de Meta.

Lámina de la presentación de Meta en Hot Chips con las consideraciones de diseño de la cuarta generación de MTIA
Lámina de la presentación de Meta en Hot Chips con las consideraciones de diseño de la cuarta generación de MTIA

¿Por qué es raro que un mismo chip haga las dos cosas?

La combinación de entrenamiento de modelos de lenguaje con inferencia de modelos de recomendación por deep learning (DLRM) es inusual, porque las dos cargas tienen demandas de rendimiento muy distintas.

El entrenamiento es enormemente intensivo en cómputo, y suele requerir decenas o incluso cientos de miles de aceleradores para entrenar modelos en un tiempo razonable. La inferencia DLRM, en cambio, es un trabajo dominado por la memoria, lo que significa que la mayoría de los FLOPS que hacen bueno al chip para entrenar quedarán ociosos.

Dada la cantidad de dinero que Meta está quemando en cómputo, que sus chips hagan doble turno no es mala idea, y menos cuando uno de los dos usos es altamente rentable.

Con todo, el silicio propio difícilmente reemplace a las GPU de AMD o Nvidia en el corto plazo. Esas GPU siguen siendo mucho más apropiadas para inferencia de modelos de lenguaje y son, casi con certeza, lo que Meta Superintelligence Labs usa para entrenar modelos de frontera como Muse Spark. El hardware específico siempre ha calzado mejor con cargas bien conocidas, y los aceleradores de Meta no son la excepción.

¿Qué hay adentro del MTIA 400?

A primera vista, el MTIA se parece bastante a las GPU Rubin de Nvidia o a los aceleradores MI355X de AMD. Está basado en una arquitectura heterogénea de múltiples dies, es decir, se arma con un conjunto de chips distintos, cada uno con su tarea: dos dies de cómputo, dos dies de entrada y salida, y un die SoC que maneja la conectividad con el host y la orquestación de la carga.

La influencia de Broadcom es difícil de pasar por alto. El chip casi con seguridad fue construido con la tecnología XPU de esa casa de propiedad intelectual, que The Register analizó en detalle el año pasado. Construir un acelerador competente no es trivial, así que si buscas llegar rápido al mercado tiene sentido concentrarte en lo que hace especial a tu chip y dejarle el resto a alguien como Broadcom.

Detalle de la arquitectura de cómputo sobre la que se basa el MTIA 400 de Meta
Detalle de la arquitectura de cómputo sobre la que se basa el MTIA 400 de Meta

Los chiplets de cómputo están fabricados en un proceso de 3 nanómetros, presumiblemente de TSMC, y llevan una grilla de 6 por 8 elementos de procesamiento responsables del grueso del rendimiento. Combinados, los dos chiplets entregan 12 petaFLOPS de cómputo MXFP4 a 1,7 GHz.

Para poner eso en perspectiva, el MTIA 400 es cerca de un 20% más rápido que los aceleradores Blackwell tope de gama de Nvidia en las precisiones más altas que se usan habitualmente para entrenar, consumiendo aproximadamente la misma energía. Pero la comparación no aguanta contra lo último de Nvidia y AMD: queda entre 3 y 3,3 veces por debajo de Rubin y del Instinct MI455X, respectivamente.

ComparaciónMTIA 400Referencia
Cómputo MXFP412 petaFLOPS a 1,7 GHzgrilla 6x8 en dos chiplets de 3 nm
Contra Blackwell tope+20% en precisiones de entrenamientoconsumo similar
Contra Rubin y MI455X3 a 3,3 veces más lentogeneración actual
Memoria288 GB HBM3e (8 pilas de 36 GB)9,2 TB/s de ancho de banda
Contra generación previa+15% de ancho de bandamenos de la mitad que las GPU nuevas
Interconexión1,2 TB/s chip a chip por RDMAtransporte no revelado

Esa memoria es probablemente la razón por la que Meta posiciona la pieza como chip de entrenamiento: para inferencia de modelos de lenguaje tiene opciones bastante mejores y más rápidas. Los dos chiplets de entrada y salida aportan 1,2 TB/s de ancho de banda entre chips sobre RDMA. No se sabe qué tecnología de transporte usa Meta, pero dada la participación de Broadcom, Ethernet sería la opción obvia.

Cómo escala en el rack

Los racks del MTIA 400 de Meta se ven casi idénticos a los NVL72 de Nvidia y a los Helios de AMD
Los racks del MTIA 400 de Meta se ven casi idénticos a los NVL72 de Nvidia y a los Helios de AMD

El parecido físico del MTIA 400 con las piezas Rubin de Nvidia y la serie MI350 de AMD se extiende también al diseño del sistema. Cada cuchilla de cómputo lleva cuatro aceleradores MTIA 400 conectados vía un conmutador PCIe a una CPU x86 y a una tarjeta de red de salida.

Un rack completo se equipa con 18 cuchillas de cómputo y ocho cuchillas de conmutación, para un total de 72 aceleradores en un único dominio unificado. Con las cifras de la propia Meta, eso da del orden de 864 petaFLOPS MXFP4 por rack y unos 20,7 TB de memoria HBM3e agregada. Meta mostró una foto del rack a comienzos de año: la cuchilla de cómputo recuerda mucho a las de Helios de AMD, aunque no usa los mismos racks OCP de doble ancho.

Fotografía del rack real del MTIA 400 mostrada a comienzos de año
Fotografía del rack real del MTIA 400 mostrada a comienzos de año

Meta todavía no ha mostrado qué tan grande puede ser un clúster de sus chips, y las láminas se limitan a decir "escalamiento de varios miles de aceleradores". Aun así, a escala de rack los sistemas deberían ser bastante competentes frente a los GB200 y GB300 de Nvidia para entrenamiento.

Lo que viene: MTIA 450 y MTIA 500

Especificaciones del silicio a medida de Meta
Especificaciones del silicio a medida de Meta

Aunque el MTIA 400 apunta sobre todo al entrenamiento, Meta ya trabaja en una versión optimizada para inferencia. El MTIA 450, revelado en marzo, duplicará el ancho de banda de memoria, presumiblemente cambiando HBM3e por HBM4, mucho más rápida. Esa pieza entra en producción el próximo año y debería calzar muy bien con esos modelos de recomendación basados en lenguaje de los que la compañía viene hablando hace varios trimestres.

El MTIA 500, previsto para 2027, subirá el ancho de banda otro 50%, probablemente con cuatro pilas HBM4 adicionales, y duplicará la cantidad de chiplets de cómputo.