Saltar al contenido
Etiqueta

#inferencia

12 notas publicadas

High Bandwidth Flash: memoria de pendrive para la IA
Electrónica

High Bandwidth Flash: memoria de pendrive para la IA

Sandisk y SK Hynix apilan chips de flash NAND para crear una capa de memoria barata y de alta capacidad, pensada para servir los pesos de modelos gigantes en tareas de inferencia.

IEEE Spectrum Semiconductors
Frozen v2: el chip de Google que graba Gemini en el silicio
IA

Frozen v2: el chip de Google que graba Gemini en el silicio

El chip, atribuido a Jeff Dean, grabaría el plano de Gemini en el hardware para ser 6 a 10 veces más eficiente que los TPU actuales. Google lo desplegaría desde 2028 para abaratar la inferencia.

The Decoder
NVIDIA Confidential Computing rinde 98% del baseline sin cifrar
IA

NVIDIA Confidential Computing rinde 98% del baseline sin cifrar

El benchmark en HGX B300 con Qwen 3.5-397B-A17B-FP8 muestra menos del 8% de overhead con Confidential Computing activado.

NVIDIA Developer
OpenAI corta a la mitad el costo de ChatGPT para invitados
IA

OpenAI corta a la mitad el costo de ChatGPT para invitados

The Information reveló que la compañía optimizó la inferencia para visitantes sin cuenta y bajó a unos pocos cientos las GPU NVIDIA necesarias.

The Decoder
SGLang sirve DeepSeek-V4 en GB300 con 5x más throughput
IA

SGLang sirve DeepSeek-V4 en GB300 con 5x más throughput

Dos meses después del lanzamiento, el stack abierto pasó de 2.200 a 11.200 tok/s/GPU a la misma interactividad gracias a KV Compression V2, W4A4 MegaMoE y CUDA graphs rompibles en el prefill.

PyTorch Blog
OpenAI y Broadcom debutan Jalapeño, su ASIC de inferencia
Electrónica

OpenAI y Broadcom debutan Jalapeño, su ASIC de inferencia

El chip de unos 840 mm² (cerca del límite reticle EUV) lleva seis módulos HBM, llegó al tape-out en nueve meses y se desplegará a escala gigawatt con Microsoft desde fines de 2026.

Tom's Hardware
Groq levanta USD 650M tras el not-acqui-hire de NVIDIA
IA

Groq levanta USD 650M tras el not-acqui-hire de NVIDIA

Seis meses después de licenciar su IP de LPU a NVIDIA y perder a su fundador, la chipmaker apuesta por su negocio neocloud con 13 data centers y nuevos ejecutivos al timón.

TechCrunch AI
NVIDIA GB300 NVL72 rinde 20x más agentes que H200 en AA-AgentPerf
IA

NVIDIA GB300 NVL72 rinde 20x más agentes que H200 en AA-AgentPerf

Artificial Analysis estrenó el primer benchmark multi-vendor que mide rendimiento concurrente de agentes de IA en cargas reales de coding, con resultados normalizados por acelerador y por megawatt.

NVIDIA Developer
NVIDIA DynoSim: gemelo digital de Dynamo a 1.500× tiempo real
IA

NVIDIA DynoSim: gemelo digital de Dynamo a 1.500× tiempo real

DynoSim corre el stack de servicio de LLM como simulación discreta en Rust y mapea la frontera de Pareto del workload antes de pagar GPUs reales.

NVIDIA Developer
TokenSpeed alcanza 580 tps con Qwen3.5-397B-A17B en GPU
IA

TokenSpeed alcanza 580 tps con Qwen3.5-397B-A17B en GPU

El motor open source de LightSeek, escrito desde cero en SPMD con compilacion estatica, ataca workloads agenticos con prefix cache hibrido y disaggregacion prefill-decode para Mamba.

PyTorch Blog
NVIDIA Dynamo Snapshot: arranque 21x mas rapido en Kubernetes
IA

NVIDIA Dynamo Snapshot: arranque 21x mas rapido en Kubernetes

El sistema con CRIU mas cuda-checkpoint baja el cold-start de un gpt-oss-120b al limite fisico de memoria, evitando que GPUs facturadas queden ociosas durante el scale-up.

NVIDIA Developer

Etiquetas relacionadas

Otros temas que aparecen junto a #inferencia en nuestra cobertura editorial.