El diseno moderno de chips esta cada vez mas limitado por el tiempo de ingenieria. El desarrollo y la verificacion a nivel de transferencia de registros (RTL, por sus siglas en ingles) exigen conocimiento especializado de hardware, razonamiento preciso e interaccion repetida con herramientas de automatizacion de diseno electronico (EDA). Los modelos de lenguaje aceleraron la generacion de codigo, y los agentes de IA amplian su impacto al usar la retroalimentacion de verificacion para corregir errores de forma iterativa.
Esto es critico en RTL, donde la correccion depende de un comportamiento temporal preciso y muchos errores solo aparecen durante la validacion con herramientas. En este contexto, NVIDIA describio como el agente de evolucion de contexto agentico (ACE-RTL) y el modelo Nemotron 3 Ultra trabajan juntos para entregar precision y eficiencia lider en tareas de RTL. ACE-RTL aporta un flujo iterativo de generar, probar y reflexionar, mientras que Nemotron 3 Ultra contribuye con razonamiento de contexto largo y entrenamiento alineado con la generacion, edicion y depuracion de RTL.
¿Que es el benchmark CVDP y por que importa?

El benchmark de problemas integrales de diseno en Verilog (CVDP) evalua a los modelos de lenguaje en tareas realistas de generacion, modificacion, depuracion y verificacion de RTL. A diferencia de los benchmarks anteriores, construidos alrededor de prompts de Verilog cortos y autocontenidos, refleja mejor los problemas practicos del diseno de hardware.
La programacion RTL no consiste solo en "escribir Verilog a partir de un prompt". Un asistente practico debe leer especificaciones, entender modulos existentes, reutilizar y modificar codigo, interpretar fallas de simulacion, depurar discrepancias y proponer correcciones puntuales. Son flujos de trabajo naturalmente agenticos: los ingenieros rara vez resuelven tareas complejas de RTL en un solo intento, sino que iteran con compiladores, simuladores, herramientas de lint, inspeccion de formas de onda y retroalimentacion de verificacion.
!Figura 1. Flujo de trabajo iterativo del agente ACE-RTL
Dentro del agente ACE-RTL

Para evaluar a Nemotron 3 Ultra en un flujo agentico realista, NVIDIA emplea el agente ACE-RTL del paper ACE-RTL: When Agentic Context Evolution Meets RTL-Specialized LLMs. El agente se compone de tres piezas que cooperan: un generador, un reflector y un coordinador. El generador produce o actualiza el codigo RTL. El reflector analiza la retroalimentacion de simulacion, identifica las causas probables y entrega una guia de correccion de alto nivel. El coordinador mantiene un contexto de depuracion en evolucion entre iteraciones, decidiendo que historial y que feedback deben guiar el siguiente intento de generacion. Asi el agente construye sobre fallas previas en lugar de repetir los mismos errores.
!Figura 2. Comparacion de tasa de aprobacion con y sin el agente ACE-RTL en CVDP cid016
El agente ACE-RTL mejora de forma sustancial la tasa de aprobacion en todos los modelos evaluados. GLM 5.2 sube de 44,0% como modelo aislado a 94,3% con ACE-RTL, Kimi K2.6 pasa de 68,6% a 97,1%, y Nemotron 3 Ultra escala de 65,7% a 100,0%. Estos resultados subrayan la importancia de la retroalimentacion iterativa de herramientas y la evolucion de contexto para resolver tareas realistas de RTL.
!Figura 3. Tasa de aprobacion agentica por categorias de CVDP con el agente ACE-RTL
¿Cuanto rinde Nemotron 3 Ultra frente a la competencia?
Manteniendo fijo el agente para aislar el efecto del modelo, y a lo largo de nueve categorias de tareas de CVDP, ACE-RTL con Nemotron 3 Ultra entrega el mejor rendimiento general, con una tasa de aprobacion promedio de 97,1%, frente a 95,2% de Kimi K2.6 y 92,1% de GLM 5.2. Las ganancias son amplias: completado de RTL, generacion de especificacion a RTL, modificacion, reuso de modulos, lint y mejora de QoR, generacion de testbench y de aserciones, y depuracion. En varias categorias Nemotron 3 Ultra alcanza el 100% de aprobacion.
Lo hace, ademas, con un uso de tokens notablemente menor: 6.629 tokens por iteracion en promedio, contra 9.156 de GLM 5.2 y 22.579 de Kimi K2.6. Eso equivale a un 28% menos de tokens que GLM 5.2 y un 71% menos que Kimi K2.6, sin resignar la mayor tasa de aprobacion.
Comparativa de modelos con el agente ACE-RTL (benchmark CVDP):
| Modelo | Aprobacion promedio | Tokens por iteracion |
|---|---|---|
| Nemotron 3 Ultra | 97,1% | 6.629 |
| Kimi K2.6 | 95,2% | 22.579 |
| GLM 5.2 | 92,1% | 9.156 |
Esta combinacion de mayor precision y menor costo por token es especialmente valiosa en el coding agentico: una tasa de aprobacion mas alta significa que el agente resuelve mas problemas de hardware unicos, mientras que el menor uso de tokens reduce la sobrecarga de inferencia en cada paso de refinamiento. En terminos practicos, se pueden intentar mas tareas de RTL dentro del mismo presupuesto de computo y los ingenieros obtienen resultados mas rapido.
!Figura 4. Tasa de aprobacion promedio frente a tokens por iteracion en las categorias de CVDP
Construido para razonamiento agentico de larga duracion
Nemotron 3 Ultra es un modelo Mixture-of-Experts con arquitectura hibrida Mamba-Attention: 550B parametros totales y 55B activos, disenado para agentes de larga duracion. Fue preentrenado con 20 billones de tokens de texto, extendido a un contexto de 1M de tokens y, entre los modelos abiertos de su clase, lidera en benchmarks agenticos clave superando a modelos abiertos mas grandes pese a su menor huella.
La arquitectura hibrida Mamba-Attention mejora la eficiencia de rendimiento al reducir el costo de atencion y la huella de la cache KV, mientras que el diseno MoE mejora la precision por parametro activo, entregando hasta 5 veces mas rendimiento y 30% menos costos frente a otros modelos abiertos. Para los flujos RTL la eficiencia importa porque el contexto del agente crece rapido: una sola iteracion de depuracion puede incluir la especificacion, el codigo del modulo, el RTL generado, la salida del simulador, las fallas de aserciones y los intentos de correccion previos.
Para dimensionarlo en terminos de hardware accesible, el checkpoint BF16 de 550B parametros excede por lejos la capacidad de una GPU de escritorio: pesa cientos de gigabytes, muy por encima de los 24 GB de una RTX de gama alta, por lo que su operacion apunta a servidores con aceleradores de centro de datos como los H100, no a estaciones de trabajo individuales.
¿Como se entreno para tareas de RTL?
!Figura 5. Pipeline de generacion de datos sinteticos para RTL
La capacidad RTL de Nemotron 3 Ultra se apoya en el pipeline de generacion de datos sinteticos propuesto en el paper de ACE-RTL. El objetivo es crear datos de entrenamiento de alta calidad que reflejen como trabajan en la practica los ingenieros y los agentes: no solo generar codigo a partir de especificaciones, sino tambien modificar implementaciones existentes y depurar disenos con fallas.
El pipeline parte de disenos RTL semilla de alta calidad filtrados de repositorios publicos. Luego, modelos abiertos los convierten en muestras de entrenamiento tipo instruccion. La innovacion clave es la diversidad de tareas: ademas de generacion de especificacion a RTL, se crean tareas de edicion y depuracion. Para la depuracion, el pipeline inyecta errores realistas en los disenos semilla, como transiciones incorrectas de maquinas de estados finitos o violaciones de handshake y de temporizacion, de modo que el modelo aprenda a reparar RTL defectuoso usando tanto el contexto de codigo como el feedback.
Todas las muestras generadas pasan por un filtro de datos antes del entrenamiento, que incluye chequeos de sintaxis, descontaminacion respecto al benchmark y puntuacion basada en rubricas con un modelo como juez para evaluar la alineacion semantica entre especificacion e implementacion.
Integracion con las herramientas EDA lideres
Nemotron 3 Ultra es un modelo abierto y puede usarse hoy en las herramientas en las que los equipos de ingenieria ya confian, con socios como:
- Cadence: el ChipStack AI SuperAgent se integra con Nemotron 3 Ultra para coordinar agentes especializados en generacion de RTL, creacion de testbench, orquestacion de regresiones y depuracion.
- Siemens: el modelo se combina con el Questa One Agentic Toolkit para detectar problemas antes, y se integra con Fuse EDA AI Agent con hasta 5 a 10 veces mayor eficiencia de tokens.
- Synopsys AgentEngineer: apoyado en Nemotron 3 Ultra, apunta a un cierre de verificacion autonomo con un sistema multiagente cuyo Openshell Sandbox puede reducir semanas de verificacion manual a horas.




