
PyTorch lleva Helion a las TPU de Google con kernels autoajustados
El nuevo backend compila el lenguaje de kernels de PyTorch a Pallas y alcanza 838 TFLOPs en atención flash sobre una TPU v7, cerca del 79% de utilización de un tensor core.
10 notas publicadas

El nuevo sistema de plugins de PyTorch-Triton carga pases y extensiones en tiempo de ejecucion y activa por defecto las TLX de Meta, con hasta 15% mas rendimiento que las librerias del fabricante.

Ingenieros de Meta muestran cómo fundir operaciones de normalización como LayerNorm y RMSNorm dentro de los kernels GEMM y de atención para ocultar hasta el 90% de su latencia en GPU B200.

NVIDIA explica cómo combinar operaciones en un solo kernel reduce el tráfico a memoria global y el overhead de lanzamiento, con ejemplos en CUDA C++, torch.compile y cuda.compute.

El runtime de programacion distribuida pasa de CUDA-only a soportar el stack de AMD Instinct MI300 y MI355, con recuperacion sin checkpoints validada en clusters de hasta 256 GPUs.

Por qué los nombres que fallan en CI no coinciden con los del código fuente, cómo funciona instantiate_device_type_tests() y cuál es la ruta oficial para reproducir un fallo en local sin adivinar.

El framework open source compone SGLang, Megatron-LM y Ray sobre PyTorch para hacer manejable el post-training por refuerzo de modelos densos y MoE a escala de cluster.

Large Language Models Demystified combina arquitectura transformer, PyTorch, LoRA, RLHF y RAG en cinco módulos online con créditos de desarrollo profesional y un badge digital.

La integración con vLLM aceleró normalización, cuantización fusionada y scaled_mm en H100, mientras que B200 sigue limitado por el backend GEMM de Triton sobre Blackwell.

El kernel Triton desarrollado por Meta para GPUs Blackwell aprovecha el patrón block-diagonal de los modelos de ranking para eliminar pasos enteros del algoritmo y acelerar 2,50x el backward pass.
Otros temas que aparecen junto a #pytorch en nuestra cobertura editorial.