Las cargas de trabajo de inteligencia artificial con agentes consumen 15 veces más tokens que una consulta de chat simple, según datos de OpenRouter. La razón está en cómo trabaja un agente.
Pensemos en lo que ocurre cuando un agente investiga una empresa para tomar una decisión de inversión. Consulta bases de datos financieras, busca noticias y presentaciones regulatorias, invoca a un subagente para correr comparaciones con pares y modelar valorizaciones, y luego sintetiza todo en una recomendación. Los agentes y sus subagentes siguen razonando hasta terminar la tarea, lo que dispara la demanda de tokens. En cada paso, los tokens acumulados se convierten en la entrada del siguiente, y eso vuelve central el manejo de contexto largo.

El mismo patrón se repite en todos los casos de uso con agentes, desde desarrollo de software hasta atención al cliente e investigación profunda. A medida que esta modalidad entra en producción en distintas industrias, la infraestructura que la ejecuta debe responder a esa demanda de tokens de manera eficiente.
¿Qué dicen exactamente las cifras de Nvidia?
Nuevos datos de rendimiento medido muestran que los sistemas Vera Rubin NVL72 entregan hasta 30 veces más rendimiento por megavatio que los NVIDIA GB300 NVL72 en cargas de trabajo con agentes, según la compañía. Nvidia midió ese rendimiento de inferencia usando la carga AgentX de SemiAnalysis, compuesta por sesiones reales grabadas de programación con agentes, preservando el crecimiento efectivo del contexto, las llamadas a herramientas y la creación de subagentes.
Para una instalación limitada por potencia disponible, eso se traduce directamente en 30 veces más trabajo con la misma huella energética.
| Afirmación de Nvidia | Comparación | Estado de verificación |
|---|---|---|
| Hasta 30x rendimiento por megavatio | Vera Rubin NVL72 contra GB300 NVL72 | pendiente de revisión de SemiAnalysis |
| Hasta 35x menor costo por millón de tokens | Vera Rubin NVL72 contra GB300 NVL72 | pendiente de revisión |
| Hasta 15x rendimiento por megavatio | GB300 NVL72 contra arquitectura Hopper | publicado por Nvidia |
| Hasta 40% más GPU por presupuesto de megavatio | tecnologías DSX MaxLPS | dato de la compañía |
La propia empresa aclara dos límites importantes de estas mediciones: los resultados están pendientes de revisión por parte de SemiAnalysis, y todavía no reflejan el rendimiento de la CPU Vera en las llamadas a herramientas, que es justamente una de las etapas más pesadas de una sesión con agentes.
¿Por qué no sirven los benchmarks tradicionales?

Las cargas con agentes se comportan de manera fundamentalmente distinta al chat o al resumen de documentos, donde las secuencias de entrada y salida suelen ubicarse entre 1.000 y 8.000 tokens. En una sesión con agentes el contexto se acumula paso a paso y puede llegar a cientos de miles de tokens de entrada, con variabilidad amplia tanto en largo de entrada como de salida entre distintas solicitudes. La medición de rendimiento, entonces, tiene que evolucionar para capturar el flujo completo del agente y no una única solicitud de inferencia.
En SemiAnalysis AgentX, la plataforma Blackwell de Nvidia entrega rendimiento destacado en varios modelos con capacidades de agente, entre ellos Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 y DeepSeek V4 Pro.
Por ejemplo, el GB300 NVL72 entrega hasta 15 veces mejor rendimiento por megavatio que la arquitectura Hopper sobre el modelo DeepSeek V4 Pro. Vera Rubin extiende esa ventaja y levanta el rendimiento a lo largo de toda la curva de Pareto.

¿Qué significa esto en dinero?
El rendimiento por megavatio impacta directamente el costo de cada token producido. Con un costo hasta 35 veces menor por millón de tokens que el GB300 NVL72, Vera Rubin NVL72 permitiría correr agentes de manera continua y a escala, según Nvidia.

Para instalaciones limitadas por potencia, el rendimiento por megavatio determina los ingresos de una fábrica de inteligencia artificial y el costo por millón de tokens define el margen de ganancia sobre esos ingresos. Las tecnologías NVIDIA DSX MaxLPS administran la potencia a nivel de GPU, de rack y de carga de trabajo para habilitar hasta 40% más GPU dentro del mismo presupuesto de megavatios.
¿Qué técnicas explican la diferencia?
Nvidia atribuye las ganancias a un conjunto de optimizaciones que operan en simultáneo:
- Servicio desagregado: separa el procesamiento de contexto de la generación de respuesta, para que cada etapa escale de forma independiente.
- Ajuste de tasas: sincroniza las velocidades a las que las GPU de cada etapa producen tokens.
- Paralelismo de expertos a gran escala: distribuye las subredes expertas de los modelos de mezcla de expertos a lo largo del dominio de GPU.
- Caché KV distribuida: extiende la memoria por el dominio de GPU, con descarga por niveles del contexto menos activo hacia el anfitrión y el almacenamiento.
- Enrutamiento consciente de la caché: dirige cada solicitud entrante a las GPU que ya tienen el contexto relevante en memoria.
- Núcleos CUDA fusionados como MegaMoE: combinan muchas operaciones de cómputo y de comunicación entre GPU en una sola pasada.
Las GPU Rubin suman núcleos Tensor de quinta generación y motor Transformer de tercera generación, más cuantización NVFP4 que comprime los pesos del modelo a precisión de 4 bits. La interconexión NVLink, ahora en su sexta generación, entrega 10 veces más tasa de paquetes y 3 veces menos latencia que las alternativas Ethernet comerciales, según la compañía.
La plataforma completa es una arquitectura de siete chips que incluye la CPU Vera, la Groq 3 LPU, el conmutador NVLink 6, la DPU BlueField-4, el Spectrum-6 SPX y la SuperNIC ConnectX-9. Vera Rubin está en producción plena y escalando en el ecosistema, según Nvidia.




