La IA agentica traslada cada vez mas del camino critico de ejecucion hacia la CPU. Los agentes operan en entornos aislados para ejecutar codigo, invocar herramientas, recuperar contexto, consultar bases de datos y analizar resultados antes de devolver informacion al modelo. Cuando esos ciclos corren en paralelo a escala de una fabrica de IA, el rendimiento de la CPU pasa a definir tanto la respuesta de cada agente como el rendimiento total del sistema.
Eso crea un punto de diseño distinto. Las cargas de agentes dependen de un rendimiento de un solo hilo fuerte incluso con el socket a plena carga, de suficiente ancho de banda de memoria por nucleo, de latencia predecible bajo concurrencia y del manejo eficiente de flujos de control irregulares y cadenas de dependencias largas. Son requisitos distintos a los de las CPU de nube tradicionales, que suelen priorizar la densidad de nucleos.
La NVIDIA Vera CPU se construyo para esta clase de carga, con el nucleo Olympus en el centro de su diseño.
¿Que hace distinto al nucleo Olympus?
Olympus se desarrollo mediante un co-diseño extremo a lo largo de la plataforma Vera Rubin, abarcando CPU, GPU, redes, almacenamiento, memoria y software. Es el motor de computo de la Vera CPU, diseñado desde cero para maximizar las instrucciones por ciclo (IPC) en cargas de infraestructura de IA altamente concurrentes. Combina alto rendimiento por hilo, ejecucion fuera de orden profunda y tecnologias de aceleracion de memoria.

El nucleo se organiza en cuatro bloques. El front end mantiene al nucleo abastecido de instrucciones utiles en pilas de software con muchas ramificaciones. En su centro esta un predictor de ramas neuronal, diseñado para mejorar la precision en patrones dificiles y estadisticamente sesgados. Al reducir la ejecucion por caminos erroneos y admitir hasta dos ramas tomadas por ciclo, junto con un motor de decodificacion de 10 vias, sostiene el flujo de control cuando el comportamiento del software es irregular.
El mid core expone y acelera el paralelismo oculto: un motor de renombrado amplio, un buffer de reordenamiento grande y capacidades como el renombrado de memoria y la prediccion de valores reducen los bloqueos en codigo con muchos punteros. El motor de ejecucion despacha operaciones enteras, de rama, vectoriales, de punto flotante, criptograficas y de memoria sobre un backend ancho. El subsistema de cache suma una jerarquia profunda y un prefetcher de grafos para cargas de analitica intensiva.
Multihilo espacial para llamadas a herramientas
El multihilo importa en cargas de agentes, que suelen ser en rafagas y guiadas por eventos. El multihilo simultaneo (SMT) tradicional comparte un nucleo entre dos hilos, pero esa competencia por recursos genera un efecto de "vecino ruidoso" que degrada el rendimiento y la latencia de cola.

La Vera CPU adopta un enfoque distinto con NVIDIA Spatial Multithreading. En vez de depender solo del uso compartido oportunista, el ancho nucleo Olympus particiona los recursos de forma mas efectiva entre dos hilos: puede operar como un nucleo de un solo hilo de alto rendimiento cuando se necesita el maximo por hilo, o como dos contextos mas aislados cuando hace falta mayor densidad. Con 88 nucleos Olympus y 176 hilos, la Vera CPU soporta un gran numero de tareas de agentes concurrentes con menor interferencia y latencia mas consistente.
Malla coherente y memoria de alto ancho de banda
Un nucleo de alto IPC entrega todo su valor solo si el resto del procesador lo mantiene abastecido. La Vera CPU empareja al nucleo Olympus con la NVIDIA Scalable Coherency Fabric (SCF), que ofrece 3,4 TB/s de ancho de banda en el chip y cache unificada, y con memoria SOCAMM2 LPDDR5X que entrega hasta 1,2 TB/s de ancho de banda agregado con alta fiabilidad y eficiencia.

El movimiento de datos seguro y escalable se apoya en NVLink-C2C coherente, una arquitectura de doble socket con un solo dominio NUMA, PCIe 6.4, CXL 3.1 y Confidential Computing, lo que habilita un rendimiento predecible y el aislamiento seguro de maquinas virtuales a lo largo de la fabrica de IA.




