
Helion llega al hub de kernels de Hugging Face
El lenguaje de dominio específico de PyTorch para escribir kernels de alto rendimiento ya se puede empaquetar, autoajustar y distribuir desde el Hub, con configuraciones preajustadas incluidas.
7 notas publicadas

La conferencia en Shanghái sumó tres miembros a la fundación y dejó una cifra que ordena el panorama: los modelos de pesos abiertos chinos pasaron del 2 al 45 por ciento del tráfico en OpenRouter.

PyTorch habilita el modelo abierto de 30 mil millones de parámetros de Meta en GPU NVIDIA y Mac con silicio de Apple, con decodificación especulativa DFlash y contexto de 128K tokens.

El nuevo backend compila el lenguaje de kernels de PyTorch a Pallas y alcanza 838 TFLOPs en atención flash sobre una TPU v7, cerca del 79% de utilización de un tensor core.

El nuevo sistema de plugins de PyTorch-Triton carga pases y extensiones en tiempo de ejecución y activa por defecto las TLX de Meta, con hasta 15% más rendimiento que las librerías del fabricante.

Ingenieros de Meta muestran cómo fundir operaciones de normalización como LayerNorm y RMSNorm dentro de los kernels GEMM y de atención para ocultar hasta el 90% de su latencia en GPU B200.

NVIDIA explica cómo combinar operaciones en un solo kernel reduce el tráfico a memoria global y el overhead de lanzamiento, con ejemplos en CUDA C++, torch.compile y cuda.compute.
Otros temas que aparecen junto a #pytorch en nuestra cobertura editorial.