
IA
PyTorch: normalización casi gratis fusionando kernels
Ingenieros de Meta muestran cómo fundir operaciones de normalización como LayerNorm y RMSNorm dentro de los kernels GEMM y de atención para ocultar hasta el 90% de su latencia en GPU B200.
PyTorch Blog