NVIDIA liberó Nemotron 3.5 Lightning, el primer modelo de su nueva línea Nemotron 3.5, y los resultados de evaluación independiente ya están sobre la mesa. La plataforma de benchmarking Artificial Analysis midió el modelo y confirmó la apuesta de la empresa: no busca ser el más inteligente de su categoría, sino el más rápido.

El modelo sucede directamente al Nemotron 3 Nano 30B A3B y conserva su arquitectura híbrida Mamba-Transformer, con 31.600 millones de parámetros totales y solo 3.600 millones activos por token.

¿Qué tan inteligente es Lightning?

Según Artificial Analysis, el modelo anota 24 puntos en el Intelligence Index, nueve más que su antecesor (15). Con eso queda a la par del gpt-oss-120b de OpenAI (24) y apenas detrás del propio Nemotron 3 Super (26), que es unas cuatro veces más grande.

Los modelos chicos más capaces de su rango siguen adelante: Qwen3.6 35B A3B llega a 32 y el reciente Muse Glimmer de Meta, a 35.

¿Dónde está la ventaja real?

En velocidad. En pruebas previas al lanzamiento con los pesos finales NVFP4, el modelo alcanzó cerca de 670 tokens por segundo, el mayor rendimiento de salida entre todos los modelos comparados y casi el doble que Gemini 3.5 Flash-Lite de Google (386 tokens/s).

La diferencia se nota en el tiempo por tarea: una del Intelligence Index le toma alrededor de 0,5 minutos, mientras que Qwen3.6 35B A3B necesita unos 3,5 minutos y Gemma 4 31B, cerca de 5,8.

Tabla comparativa (elaboración propia con datos publicados por Artificial Analysis):

ModeloIntelligence IndexTiempo por tarea
Nemotron 3.5 Lightning24~0,5 min
gpt-oss-120b24no informado
Nemotron 3 Super26no informado
Qwen3.6 35B A3B32~3,5 min
Muse Glimmer35no informado
Gemini 3.5 Flash-Lite37similar a Lightning
GPT-5.6 Luna (max)52menos de 2 min

Los modelos propietarios siguen dominando la frontera general de eficiencia. Gemini 3.5 Flash-Lite anota 37 puntos con un tiempo por tarea parecido, y GPT-5.6 Luna (max) llega a 52 en menos de dos minutos.

El salto está en los benchmarks agénticos

Ahí aparece la mejora más grande. En GDPval-AA v2 el modelo alcanza un Elo de 824, es decir 334 puntos más que Nemotron 3 Nano. Supera tanto a gpt-oss-120b (800) como al más grande Nemotron 3 Super (698). En Terminal-Bench v2.1 pasa de 7% a 24,3%, muy cerca del 26,2% de gpt-oss-120b.

De acuerdo con Artificial Analysis, NVIDIA trabajó con socios como CodeRabbit y Harvey en el post-entrenamiento para reforzar el desempeño en dominios específicos.

¿Qué hardware pide para correr en local?

NVIDIA entrega el modelo bajo la licencia permisiva OpenMDW-1.1, en pesos BF16 y NVFP4. La variante NVFP4 también anota 24 en el Intelligence Index, con pérdida mínima de calidad frente a la versión de mayor precisión. Es un modelo de razonamiento de solo texto y admite una ventana de contexto de un millón de tokens.

Los pesos ya están disponibles y hay inferencia serverless en DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius y Crusoe, entre otros.

Un cálculo propio ayuda a dimensionar el requisito local: 31.600 millones de parámetros a 4 bits (NVFP4) equivalen a unos 15,8 GB solo de pesos. Eso lo deja fuera de una tarjeta de 12 GB de VRAM y dentro del alcance de una de 24 GB, el rango de las GPU de gama alta que se consiguen en el retail chileno, sin necesidad de hardware de centro de datos. En BF16, los mismos parámetros ocupan del orden de 63 GB y el modelo vuelve al terreno de las tarjetas profesionales.

La tesis de fondo

La apuesta de NVIDIA por la eficiencia sobre el tamaño no es nueva. En un paper muy discutido el año pasado, sus investigadores plantearon que los modelos bajo 10.000 millones de parámetros pueden resolver la mayoría de las cargas de trabajo de agentes tan bien como los de 70.000 a 175.000 millones, a un décimo o un treintavo del costo.

Nemotron 3.5 Lightning tiene 31.600 millones de parámetros pero activa solo 3.600 por paso, lo que lo ubica en esa misma clase liviana. Con 670 tokens por segundo y ventaja agéntica sobre modelos mayores, es hasta ahora la prueba más concreta de esa tesis a nivel de producto.