Saltar al contenido
Etiqueta

#pytorch

10 notas publicadas

Triton 3.7 permite extender el compilador de GPU sin forks
IA

Triton 3.7 permite extender el compilador de GPU sin forks

El nuevo sistema de plugins de PyTorch-Triton carga pases y extensiones en tiempo de ejecucion y activa por defecto las TLX de Meta, con hasta 15% mas rendimiento que las librerias del fabricante.

PyTorch Blog
PyTorch: normalización casi gratis fusionando kernels
IA

PyTorch: normalización casi gratis fusionando kernels

Ingenieros de Meta muestran cómo fundir operaciones de normalización como LayerNorm y RMSNorm dentro de los kernels GEMM y de atención para ocultar hasta el 90% de su latencia en GPU B200.

PyTorch Blog
Fusión de kernels en CUDA para acelerar la memoria GPU
IA

Fusión de kernels en CUDA para acelerar la memoria GPU

NVIDIA explica cómo combinar operaciones en un solo kernel reduce el tráfico a memoria global y el overhead de lanzamiento, con ejemplos en CUDA C++, torch.compile y cuda.compute.

NVIDIA Developer
PyTorch Monarch llega a GPUs AMD con tolerancia a fallos en ROCm
IA

PyTorch Monarch llega a GPUs AMD con tolerancia a fallos en ROCm

El runtime de programacion distribuida pasa de CUDA-only a soportar el stack de AMD Instinct MI300 y MI355, con recuperacion sin checkpoints validada en clusters de hasta 256 GPUs.

PyTorch Blog
PyTorch abre el capó de su infraestructura de tests generados
IA

PyTorch abre el capó de su infraestructura de tests generados

Por qué los nombres que fallan en CI no coinciden con los del código fuente, cómo funciona instantiate_device_type_tests() y cuál es la ruta oficial para reproducir un fallo en local sin adivinar.

PyTorch Blog
RadixArk libera Miles, stack PyTorch para RL en LLMs frontier
IA

RadixArk libera Miles, stack PyTorch para RL en LLMs frontier

El framework open source compone SGLang, Megatron-LM y Ray sobre PyTorch para hacer manejable el post-training por refuerzo de modelos densos y MoE a escala de cluster.

PyTorch Blog
IEEE lanza programa virtual de cinco cursos sobre LLMs
Robótica

IEEE lanza programa virtual de cinco cursos sobre LLMs

Large Language Models Demystified combina arquitectura transformer, PyTorch, LoRA, RLHF y RAG en cinco módulos online con créditos de desarrollo profesional y un badge digital.

IEEE Spectrum AI
PyTorch integra Helion en vLLM para acelerar inferencia FP8
IA

PyTorch integra Helion en vLLM para acelerar inferencia FP8

La integración con vLLM aceleró normalización, cuantización fusionada y scaled_mm en H100, mientras que B200 sigue limitado por el backend GEMM de Triton sobre Blackwell.

PyTorch Blog
TLX Block Attention: 1,85x sobre Flash Attention v2 en NVIDIA B200
IA

TLX Block Attention: 1,85x sobre Flash Attention v2 en NVIDIA B200

El kernel Triton desarrollado por Meta para GPUs Blackwell aprovecha el patrón block-diagonal de los modelos de ranking para eliminar pasos enteros del algoritmo y acelerar 2,50x el backward pass.

PyTorch Blog

Etiquetas relacionadas

Otros temas que aparecen junto a #pytorch en nuestra cobertura editorial.