
NVIDIA Jetson ya corre modelos de razonamiento sin conexión
La cuantización NVFP4 combinada con decodificación especulativa multiplica por 6,28 el rendimiento frente a BF16, según las pruebas que NVIDIA publicó para sus placas AGX Thor y AGX Orin.
4 notas publicadas

La compañía publicó un marco de trabajo que ordena el cálculo alrededor del uso real de la carga, con cuatro escenarios de empresa y sus requisitos de memoria.

Las versiones cuantizadas del modelo abierto de 27.000 millones de parámetros funcionan en equipos de 32 GB de RAM, y hasta en uno de 16 GB con calidad degradada.

La destilación consciente de cuantización (QAD) permite llevar los pesos a 4 bits y triplicar el rendimiento sin perder la precisión del modelo original en BF16.
Otros temas que aparecen junto a #cuantizacion en nuestra cobertura editorial.