
NVIDIA TensorRT: monitorear y cancelar builds de motores
La API IProgressMonitor, incluida en TensorRT desde hace varias versiones, permite seguir el progreso en tiempo real y abortar una compilación larga antes de malgastar horas de GPU.
5 notas publicadas

Una guía técnica de NVIDIA explica por qué la forma de un modelo (capas cuadradas, dimensiones múltiplos de 128 y más ancho que profundo) define cuánto rendimiento se saca de una GPU Blackwell.

NVIDIA explica cómo combinar operaciones en un solo kernel reduce el tráfico a memoria global y el overhead de lanzamiento, con ejemplos en CUDA C++, torch.compile y cuda.compute.

El stack full-stack de inferencia sobre GB300 combina Dynamo, TensorRT-LLM, NVFP4 y NVLink para multiplicar por 20 el throughput por GPU y desplomar el costo por token.

El nuevo soporte multi-device del runtime habilita paralelismo de tensor y de contexto, y los benchmarks colocan a DeepSpeed Ulysses como la mejor estrategia para diffusion con secuencias largas.
Otros temas que aparecen junto a #inferencia ia en nuestra cobertura editorial.