
Clusters Kubernetes aislados por equipo sobre una misma GPU
NVIDIA documenta una arquitectura que combina KAI Scheduler y vCluster para dar a cada equipo su propio plano de control, con cuotas de GPU independientes y sin dividir el hardware físico.
30 notas publicadas

El PCB corto de esta variante apenas alcanzó el punto de curvatura y salvó al núcleo, así que toda la reparación se redujo a resoldar un único módulo de memoria.
Tras el lanzamiento del MI455X, AMD cumple su tradición de hacer pública la documentación ISA para desarrolladores, fortaleciendo el soporte open source en Linux.

Análisis profundo sobre el diseño de arquitecturas de modelos de IA, el rol del group size y cómo maximizar el rendimiento en hardware NVIDIA para inferencia.

La industria de la IA enfrenta una nueva restricción crítica: la eficiencia operativa. Gestionar las GPUs como activos en tierra es el desafío financiero del momento.
La propuesta de Huawei para integrar su driver Vulkan en Mesa enfrenta rechazos técnicos debido a la negativa de liberar el compilador de shaders.
El desarrollo de código abierto para las tarjetas gráficas DG2 avanza, permitiendo por fin el uso de aceleración por hardware en el driver Xe de Linux.

Andrew rescató tarjetas Tesla V100 de 2017 del mercado de segunda mano y armó una placa PCI para dos GPUs, capaz de correr modelos como Gemma 4 26B y Qwen3 35B por completo en memoria.

Aprende a integrar herramientas de verificación de errores y depuración en tiempo real para optimizar el rendimiento de tus aplicaciones de trazado de rayos en la GPU.

La API IProgressMonitor, incluida en TensorRT desde hace varias versiones, permite seguir el progreso en tiempo real y abortar una compilación larga antes de malgastar horas de GPU.

La nueva GPU de la plataforma Vera Rubin apunta a las cargas de IA agentica con 336 mil millones de transistores, 288 GB de HBM4 y 50 petaflops en formato NVFP4.

El fabricante de chips financia al laboratorio detras de Claude, que a cambio desplegara hasta 2 gigavatios de GPU AMD Instinct MI450 en sistemas Helios desde 2027.

La nueva plataforma de centros de datos de NVIDIA ya corre en CoreWeave, Google Cloud, Microsoft Azure y Oracle, con un rediseño integral que va del chip a la red eléctrica.
La compañía detalla su avance para soportar la representación intermedia SPIR-V en ROCm, con la meta de un único binario portable entre distintas arquitecturas de GPU.

El nuevo sistema de plugins de PyTorch-Triton carga pases y extensiones en tiempo de ejecucion y activa por defecto las TLX de Meta, con hasta 15% mas rendimiento que las librerias del fabricante.
La vista previa técnica del stack de cómputo GPU de código abierto de AMD llega antes del evento Advancing AI, con mejoras de hasta 16% en cargas de IA como ComfyUI y más soporte para Windows.

NVIDIA reemplazó la comunicación por MPI orquestada desde la CPU con acceso directo entre GPUs vía NVSHMEM, y logró hasta el doble de rendimiento en los clústeres Eos y GB200 NVL72.

Una guía técnica de NVIDIA explica por qué la forma de un modelo (capas cuadradas, dimensiones múltiplos de 128 y más ancho que profundo) define cuánto rendimiento se saca de una GPU Blackwell.

NVIDIA explica cómo combinar operaciones en un solo kernel reduce el tráfico a memoria global y el overhead de lanzamiento, con ejemplos en CUDA C++, torch.compile y cuda.compute.

La plataforma de red de acceso radio acelerada por GPU logra hasta 1,62x más rendimiento en beamforming y 1,3x en adaptación de enlace frente a los métodos tradicionales basados en CPU.

El proyecto reparte cada píxel entre 8.192 chips CH570 a 100 MHz para construir una matriz LED RGB de 320x200, con un consumo de 2 kW alimentado por una fuente Corsair ATX de 3 kW.

Brian Benchoff adaptó el algoritmo PathFinder de FPGAs para trazar miles de nets en malla Manhattan con vías blind/buried, empaquetado como plugin abierto de KiCad.

El nuevo soporte multi-device del runtime habilita paralelismo de tensor y de contexto, y los benchmarks colocan a DeepSpeed Ulysses como la mejor estrategia para diffusion con secuencias largas.

Un usuario de Reddit logra que el sistema operativo de Valve corra sobre la GPU discreta de Intel, pero el camino exige una Radeon como puente, un instalador parchado y Resizable BAR activado.

Un sample de ingeniería de la familia Xe-HP llegó por error a un coleccionista que esperaba un Ponte Vecchio: 7.860 shader cores en dos tiles a 1,00 GHz y 300 W.

Un SDK experimental de Windows ya permite correr Language Model APIs sobre tarjetas Nvidia RTX 30-series con al menos 6 GB de VRAM, abriendo la IA local a desktops sin chip dedicado.

Investigadores de la Universidad de Twente proponen ajustar la frecuencia de reloj del GPU por kernel para reducir el consumo eléctrico sin perder rendimiento.

El framework integrado en CUDA 13.3 usa algoritmos genéticos para optimizar el compilador GPU por workload, en vez de aplicar heurísticas universales.

Con CUDA 13.3, NVIDIA habilita el modelo de programación por tiles en C++ y promete que el compilador se haga cargo de la paralelización, los tensor cores y el movimiento de memoria.

NVIDIA lanza CUDA Tile sobre Hopper, libera CUDA Python 1.0 con green contexts y process checkpointing, y debuta CompileIQ con hasta 15% de speedup en GEMM y attention.
Otros temas que aparecen junto a #gpu en nuestra cobertura editorial.