Saltar al contenido
Etiqueta

#blackwell

19 notas publicadas

JAX descarga activaciones al host y sube 57% el rendimiento
IA

JAX descarga activaciones al host y sube 57% el rendimiento

El host offloading libera memoria HBM al mover activaciones a la RAM del sistema, con hasta 57% mas rendimiento al entrenar modelos como DeepSeek-V3 671B en NVIDIA Grace Blackwell.

NVIDIA Developer
NVIDIA NTP mantiene el entrenamiento LLM si caen GPUs
IA

NVIDIA NTP mantiene el entrenamiento LLM si caen GPUs

Nonuniform Tensor Parallelism reconfigura el paralelismo tensorial en caliente cuando una GPU falla dentro de un dominio NVLink, con overhead bajo 1%.

NVIDIA Developer
NVIDIA Confidential Computing rinde 98% del baseline sin cifrar
IA

NVIDIA Confidential Computing rinde 98% del baseline sin cifrar

El benchmark en HGX B300 con Qwen 3.5-397B-A17B-FP8 muestra menos del 8% de overhead con Confidential Computing activado.

NVIDIA Developer
NVIDIA GQE: motor SQL 7,5x más rápido en GPUs Blackwell
IA

NVIDIA GQE: motor SQL 7,5x más rápido en GPUs Blackwell

La arquitectura GPU Query Engine descarga la descompresión al bloque dedicado del Blackwell y aprovecha HBM y NVLink-C2C para acelerar consultas SQL sobre grandes volúmenes de datos.

NVIDIA Developer
NVIDIA baja hasta 5x el costo por token de DeepSeek V4 en Blackwell
IA

NVIDIA baja hasta 5x el costo por token de DeepSeek V4 en Blackwell

El stack full-stack de inferencia sobre GB300 combina Dynamo, TensorRT-LLM, NVFP4 y NVLink para multiplicar por 20 el throughput por GPU y desplomar el costo por token.

NVIDIA Blog
Claude corre en NVIDIA GB300 Blackwell Ultra desde Azure Foundry
IA

Claude corre en NVIDIA GB300 Blackwell Ultra desde Azure Foundry

Anthropic, Microsoft y NVIDIA declaran la disponibilidad general de Claude sobre GPUs Blackwell Ultra y redes Quantum-X800 InfiniBand en Microsoft Foundry para agentes empresariales.

NVIDIA Blog
NVIDIA cuantiza Nemotron 3 Ultra a NVFP4 con 5,9x más throughput
IA

NVIDIA cuantiza Nemotron 3 Ultra a NVFP4 con 5,9x más throughput

El equipo de NVIDIA reduce el checkpoint del modelo de 550B desde 1.121 GB en BF16 a 352 GB en NVFP4, con la técnica four-over-six que recupera 98,5% de la precisión sobre Blackwell.

NVIDIA Developer
AWS EC2 G7 estrena Blackwell con 4.6x mas inferencia que G6
IA

AWS EC2 G7 estrena Blackwell con 4.6x mas inferencia que G6

Las nuevas instancias suman hasta 8 RTX PRO 4500 Blackwell, 256 GB de memoria GPU y 700 Gbps en EFA, y NVIDIA cuVS pasa a default en OpenSearch Serverless.

NVIDIA Blog
SpaceX renta GPUs por USD 28.000M, doble que Coreweave
IA

SpaceX renta GPUs por USD 28.000M, doble que Coreweave

El tercer contrato GPU de SpaceX, ahora con Reflection AI, lleva sus rentas anuales a USD 28.000 millones según Jamin Ball: doble de la facturación actual de Coreweave.

Latent Space
DFlash: hasta 15x más inferencia LLM en NVIDIA Blackwell
IA

DFlash: hasta 15x más inferencia LLM en NVIDIA Blackwell

El método de speculative decoding por bloques desplaza a EAGLE-3 y libera 20 checkpoints abiertos en Hugging Face para Hopper y Blackwell.

NVIDIA Developer
NVIDIA Blackwell domina MLPerf Training 6.0 con 8.192 GPUs
IA

NVIDIA Blackwell domina MLPerf Training 6.0 con 8.192 GPUs

Fue la única plataforma en presentar resultados sobre cada test, incluyendo DeepSeek-V3 (671B parámetros) y GPT-OSS-20B, y escaló a 8.192 GPUs Blackwell Ultra en datacenters de producción.

NVIDIA Developer
FP8 y NVFP4 en Transformers: hasta 3,48x con Blackwell B300
IA

FP8 y NVFP4 en Transformers: hasta 3,48x con Blackwell B300

NVIDIA muestra cómo medir GEMM por GEMM la ganancia real de las precisiones bajas en CodonFM 5B, separando el costo de cuantización del rendimiento puro del kernel.

NVIDIA Developer
Blackwell barre MLPerf Training 6.0: NVIDIA escala a 8.192 GPU
IA

Blackwell barre MLPerf Training 6.0: NVIDIA escala a 8.192 GPU

GB200 NVL72 y GB300 NVL72 lideran las siete pruebas del benchmark, incluyendo las nuevas cargas MoE DeepSeek-V3 671B y GPT-OSS-20B, con CoreWeave entrenando en 2,02 minutos.

NVIDIA Blog
NVIDIA Blackwell lidera el primer benchmark de IA agéntica
IA

NVIDIA Blackwell lidera el primer benchmark de IA agéntica

El GB300 NVL72 corre 20× más agentes por megawatt que el HGX H200 en AgentPerf, el primer benchmark de Artificial Analysis que mide cargas reales de agentes encadenando llamadas LLM.

NVIDIA Blog
MiniMax M3: MoE de 428B con 1M de contexto en Blackwell
IA

MiniMax M3: MoE de 428B con 1M de contexto en Blackwell

Sirve contextos de 1 millón de tokens con costo por token 20 veces menor que M2, y se despliega en NVIDIA Dynamo, TensorRT-LLM, SGLang y vLLM con pesos abiertos en Hugging Face.

NVIDIA Developer
Blackwell HGX B200 marca récord STAC-AI en finanzas
IA

Blackwell HGX B200 marca récord STAC-AI en finanzas

El benchmark STAC-AI LANG6 con Llama 3.1 8B y 70B muestra hasta 2,8x más rendimiento por GPU frente a Hopper en cargas de inferencia con documentos EDGAR.

NVIDIA Developer
NVIDIA RTX PRO 4500 Blackwell: 2x más rápido en genómica y plegamiento
IA

NVIDIA RTX PRO 4500 Blackwell: 2x más rápido en genómica y plegamiento

La nueva GPU Server Edition acelera Parabricks, Minimap2, fq2bam y DeepVariant; con cuEquivariance y Openfold3 también gana 2,3x sobre la L4 al inferir estructuras de proteínas.

NVIDIA Developer
TLX Block Attention: 1,85x sobre Flash Attention v2 en NVIDIA B200
IA

TLX Block Attention: 1,85x sobre Flash Attention v2 en NVIDIA B200

El kernel Triton desarrollado por Meta para GPUs Blackwell aprovecha el patrón block-diagonal de los modelos de ranking para eliminar pasos enteros del algoritmo y acelerar 2,50x el backward pass.

PyTorch Blog

Etiquetas relacionadas

Otros temas que aparecen junto a #blackwell en nuestra cobertura editorial.