Arm está introduciendo sus plataformas Neoverse CSS N4 de próxima generación al sector de la nube, las cuales integran hasta 128 núcleos por chip y están fabricadas mediante el proceso N3P de TSMC. El Compute Subsystem (CSS) de Arm es un programa semi-personalizado que permite a los clientes diseñar chips basados en la propiedad intelectual de la firma, configurando elementos clave como el recuento de núcleos, tamaño de caché, E/S y conectividad para ajustarse a necesidades específicas. Se trata de la misma plataforma que impulsa desde CPUs en Azure y Google Cloud hasta unidades de procesamiento de datos (DPU) en Nvidia e Intel.

Arm afirma que Neoverse CSS N4 soporta entre ocho y 128 núcleos Neoverse N4, alcanzando frecuencias de hasta 3.8 GHz. Es probable que las velocidades de reloj disminuyan a medida que aumenta el número de núcleos, aunque la compañía no aclaró las frecuencias máximas para cada configuración posible. A nivel de sistema, Neoverse CSS N4 puede escalar más allá de los 128 núcleos, con soporte para diseños de múltiples chiplets y sockets, además de compatibilidad con UCIe mediante interconexiones chip-a-chip y "PNYs específicas para socios".

Diagrama de arquitectura del Neoverse CSS N4 mostrando la disposición de núcleos y caché
Diagrama de arquitectura del Neoverse CSS N4 mostrando la disposición de núcleos y caché

El sistema admite memorias DDR5 o LPDDR6 y cuenta con hasta 256 MB de caché L3 por chip. Para la caché local, Arm incluye hasta 2 MB de caché L2 por núcleo, además de 64 KB de caché L1 de instrucciones y 64 KB de caché L1 de datos por núcleo. En cuanto a E/S, Arm soporta hasta 128 carriles de PCIe 7/6 y CXL 4.0.

Esta es una mejora significativa respecto a la plataforma Neoverse CSS N2, que alcanzaba un máximo de 64 núcleos, 1 MB de caché L2 por núcleo y 64 MB de caché L3, combinada con memorias DDR5 o LPDDR5 y 64 carriles PCIe 5.0/CXL.

Comparativa visual de densidad de núcleos entre Neoverse CSS N2 y N4
Comparativa visual de densidad de núcleos entre Neoverse CSS N2 y N4

Con 128 núcleos operando a 3 GHz y 2 MB de caché L2 por núcleo, Arm asegura que el Neoverse CSS N4 entrega el doble de rendimiento por socket que el Neoverse N3, un 1.25x más de rendimiento por vatio y 1.75x más de ancho de banda de memoria. Los núcleos de la serie N de Arm están optimizados para la eficiencia energética, mientras que los de la serie V apuntan al rendimiento máximo. Por ejemplo, Arm utilizó los bloques de construcción Neoverse CSS V3 para su propia CPU AGI, y Nvidia empleó el Neoverse V2 para su CPU Grace de generación anterior. AWS también ha utilizado núcleos de la serie V para sus chips Graviton, al igual que Google Cloud para Axion.

Los núcleos de la serie N no suelen desplegarse en CPUs de alto rendimiento. En su lugar, se integran en aceleradores menos exigentes, como el Intel IPU Adapter E2100, basado en núcleos Neoverse N1. También se han visto en cargas de trabajo de nube menos demandantes, como el Azure Cobalt 100 de Microsoft, basado en Neoverse N2. El Cobalt 200, por su parte, migró a Neoverse V3.

No se conocen muchos detalles sobre los núcleos Neoverse N4, cuyo nombre en clave es Dionysus. La hoja de ruta de Arm para 2024 indicó que también veremos el Arm Neoverse CSS V4, bajo el nombre en clave Vega. A diferencia de un anuncio tradicional de Intel o AMD, los núcleos Neoverse N4 no estarán disponibles en el mercado masivo de inmediato. El anuncio está dirigido a quienes construyen sobre la plataforma CSS, aprovechando los bloques validados de Arm para crear silicio semi-personalizado con rapidez. Arm aún no ha anunciado socios, aunque tradicionalmente solo se requieren unos pocos contratos grandes de CSS.

Gráfico de despliegues adicionales de la CPU AGI de Arm
Gráfico de despliegues adicionales de la CPU AGI de Arm

Junto con el anuncio del Arm Neoverse CSS N4, la empresa reveló despliegues adicionales de su propio chip AGI, construido con núcleos Neoverse V3. La compañía confirmó que Oracle y ByteDance implementarán estos chips, sumándose a los despliegues previamente anunciados en Meta, Lenovo, SAP, OpenAI, Cloudflare y otros. Aunque Arm ha hablado extensamente sobre la AGI, incluyendo un análisis profundo de la arquitectura del chip en Hot Chips, todavía no hemos visto cifras de rendimiento en entornos reales. Esto no es inusual, especialmente en chips basados en Arm más recientes. Por ejemplo, solo contamos con comparativas generacionales para el Azure Cobalt 200 de Microsoft y el Graviton5 de AWS. Arm ha hecho referencias vagas al rendimiento, afirmando que la AGI ofrece "más del doble de rendimiento por rack en comparación con los sistemas x86 más recientes", aunque dichas cifras se basan en estimaciones internas y no en benchmarks reales.

El AGI es una CPU de doble chip con hasta 136 núcleos Neoverse V3 y hasta 272 MB de caché L3, capaz de alcanzar frecuencias de hasta 3.7 GHz. Posee las especificaciones necesarias para competir con cualquier diseño x86 de gama alta, fabricado en un nodo de 3nm y con capacidad de hasta 6 TB de memoria por chip, funcionando a una velocidad de hasta DDR5-8800. Quizás la mayor diferencia frente a AMD e Intel fue la decisión de Arm de incluir la memoria y la E/S en el mismo chip que el cómputo, lo que, según la empresa, resulta en una latencia de memoria inferior a los 100 ns. Es el primer intento de Arm con su propio silicio de producción, aunque hasta ahora se ha posicionado como un vehículo para las aplicaciones más amplias de Arm en el centro de datos. Vía Tom's Hardware.