
IA
Qwen3.8-Flash-Next: 16.000 tokens por segundo por GPU
NVIDIA publicó la validación del modelo de Alibaba sobre el rack GB300 NVL72 y detalló la arquitectura híbrida que le permite sostener contextos de un millón de tokens sin inflar la caché KV.
NVIDIA Developer