Los motores a escala de oblea de Cerebras, cargados de SRAM, se ganaron un nicho en el servicio de modelos de IA: inferencia de latencia muy baja y alto rendimiento, la que sostiene servicios como el nivel Sol Ultrafast de ChatGPT-5.6 de OpenAI. En Hot Chips 2026 la compañía reveló las próximas dos generaciones de su hoja de ruta y detalló el nuevo diseño de rack Nexus para el acelerador CS-4.

Integrar un procesador coherente enorme en una sola porción gigante de silicio es una hazaña única en la industria. También trae límites propios. La demanda de memoria de la IA no deja de crecer, por el tamaño de los modelos (cuya ocupación se puede amortizar entre varias sesiones de inferencia) y por contextos cada vez más largos guardados en cachés KV grandes, que en cambio son únicos para cada sesión.

Los fabricantes de GPU tradicionales resolvieron parte de esa presión apilando HBM más alto y poniendo más memoria por acelerador. En un diseño a escala de oblea, donde el área ya está ocupada al 100% por lógica y memoria, sumar un recurso obliga a sacrificar otro. Y como la producción de silicio seguirá haciéndose sobre obleas de 300 mm en el futuro previsible, Cerebras tiene que buscar el crecimiento en otra dirección.

¿Por qué apilar DRAM sobre la oblea?

Esa dirección es la tercera dimensión. Cerebras anunció que empezará a expandir sus motores a escala de oblea hacia diseños apilados con el WSE del sistema CS-6, hoy a dos generaciones de distancia en la hoja de ruta. Será la primera vez que la empresa intente apilar DRAM en 3D sobre la oblea de lógica y SRAM, una movida que, según asegura, mantendrá su ventaja de rendimiento en inferencia y a la vez reducirá el área total que requiere el chip.

Ese segundo efecto no es menor. Si el área baja, Cerebras podría aumentar la cantidad de motores que fabrica, lo que aflojaría una restricción crítica para escalar el negocio en un mundo con demanda creciente de obleas.

¿Qué gana el diseño Nexus?

Mientras tanto, en el presente, la compañía sube el rendimiento de su plataforma actual con el sistema CS-4 y el rack Nexus. El CS-4 integra tres obleas WS-3T en "mochilas" autocontenidas que reúnen entrega de energía, red de escalado y refrigeración líquida en un único módulo enchufable. Como esos módulos son autónomos, los futuros motores construidos con esta arquitectura se podrán intercambiar sin cambiar el rack completo.

El arquitecto jefe de sistemas de Cerebras, JP Fricker, no ahorró palabras al describir los 5.000 cables que conectan el dominio de escalado NVLink dentro de cada rack del Rubin NVL72.

"Es un desastre", dijo, contrastándolo con el diseño más limpio y menos propenso a fallas de las interconexiones en la propia oblea y de los módulos de cómputo autocontenidos del sistema Nexus.

El diseño también separa las interfaces de entrada y salida del resto de los componentes de la mochila. Dos módulos de E/S se conectan a los bordes de la oblea y aportan conexiones RDMA sobre RoCE v2 para interoperar con otros sistemas, además de un enlace directo con las demás obleas del rack. Como esos módulos también son intercambiables, ofrecen otra ruta de actualización independiente de la oblea de cómputo.

Nexus ubica hasta 10 unidades de entrega de energía por mochila en el frente del rack, y cada grupo se puede configurar con distintos niveles de redundancia según lo que necesite el operador. El rack además provee refrigeración por aire para los componentes que lo requieran.

Del busbar al reloj: de dónde sale el doble de rendimiento

Montar los motores de forma vertical dentro de las mochilas le permite a Cerebras eliminar la placa o el sustrato que hasta ahora sostenía la oblea y toda su infraestructura de apoyo. En su lugar, la mochila conecta el gran busbar de cobre que alimenta el chip directamente contra su cara trasera. Ese contacto cercano importa: minimiza las pérdidas de potencia que ocurren en el camino, como pasa con una GPU en encapsulado BGA montada sobre un módulo con toda la circuitería de alimentación alrededor del troquel.

Cerebras traduce esa potencia ahorrada directamente en rendimiento. La compañía afirma que las pérdidas evitadas por el diseño Nexus le permiten entregar el doble de potencia al motor a escala de oblea que en diseños anteriores, lo que se traduce en frecuencias más altas y hasta el doble de rendimiento respecto del WS-3.

Con el mismo silicio base que el WS-3, cada WS-3T entrega el doble de petaFLOPS FP16 dispersos y el doble de ancho de banda desde su SRAM. La compañía no publica cifras de PFLOPS densos, posiblemente porque el diseño de flujo de datos de estos chips está construido para sacar ventaja de la dispersión de una forma que una GPU tradicional no suele aprovechar.

¿Cuánta memoria tiene realmente un CS-4?

Acá está el flanco débil. El WS-3T sigue limitado a 44 GB de memoria en toda la oblea, y tres obleas en un rack CS-4 apenas llegan a 132 GB. La distancia con la competencia es enorme.

SistemaMemoria total del rack
Cerebras CS-4 (3 obleas WS-3T)132 GB
Nvidia Vera Rubin NVL7220,7 TB de HBM
AMD Helios31 TB

Es decir, un rack de Vera Rubin lleva cerca de 157 veces más memoria que un CS-4. Esa brecha explica por qué la hoja de ruta apunta a la DRAM apilada del CS-6.

Para acomodar los modelos grandes de hoy y de mañana, Cerebras necesita escalar hacia arriba y hacia los lados. A diferencia de otros sistemas a escala de rack que dependen de Ethernet para el escalado horizontal, acá basta con conectar sistemas CS-4 entre sí usando la misma interconexión oblea a oblea que ya une los motores dentro del rack Nexus. La empresa declara 2,4 Tb/s de ancho de banda directo de escalado por oblea, para un total de 7,2 Tb/s entre chips con latencias de 2 microsegundos.

La cifra parece modesta al lado de los cientos de terabytes por segundo de un Vera Rubin NVL72 o un Helios, pero Cerebras aclara que en su arquitectura solo las activaciones del modelo viajan entre motores, así que ese ancho de banda no es el cuello de botella que aparenta. El tejido interno de la propia oblea, por lo demás, mueve 53,4 PB/s.

¿Qué viene en 2027?

La arquitectura del CS-4 sienta las bases del acelerador de próxima generación, el CS-5, que usará silicio WSE nuevo en 2027. Para modelos pequeños, la compañía dice que ese motor entregará hasta 10.000 tokens por segundo por usuario, mientras que modelos frontera más grandes, de laboratorios como DeepSeek u OpenAI, correrían a 5.000 tokens por segundo por usuario.

Como dijo el director ejecutivo de Nvidia, Jensen Huang, los agentes de IA son impacientes. Poder entregar semejante cantidad de tokens por segundo con aceleradores especializados seguirá siendo un nicho que Cerebras puede explotar junto a sus socios en OpenAI y AMD.