Saltar al contenido
Etiqueta

#inferencia

36 notas publicadas

Un modelo MoE de 30B activa solo 3B parámetros por token
IA

Un modelo MoE de 30B activa solo 3B parámetros por token

NVIDIA explica con Nemotron 3.5 Lightning en qué se diferencian los modelos densos y los de mezcla de expertos, y por qué la decisión depende del presupuesto de memoria y de la concurrencia.

NVIDIA Developer
Vera Rubin entrega hasta 30 veces más tokens por megavatio
IA

Vera Rubin entrega hasta 30 veces más tokens por megavatio

La medición de SemiAnalysis AgentX sobre el modelo DeepSeek V4 Pro compara el NVL72 de Vera Rubin contra el GB300 NVL72, y NVIDIA presentó el resultado en el AI Infra Summit.

NVIDIA Blog
DeepSeek V4.1 Flash separa los parámetros de leer y de escribir
IA

DeepSeek V4.1 Flash separa los parámetros de leer y de escribir

El modelo suma 763.000 millones de parámetros, activa 8.000 millones en la entrada y 16.000 millones en la salida, y con eso baja la caché de claves y valores hasta un octavo de la del V4 Flash.

Latent Space
DeepSeek V4.1 Flash crece 2,5 veces y usa menos memoria
Electrónica

DeepSeek V4.1 Flash crece 2,5 veces y usa menos memoria

Los 196.000 millones de parámetros N-gram del modelo se pueden mover a la RAM del sistema, y eso baja de 763 GB a 567 GB la memoria de GPU que pide para arrancar.

The Register
d-Matrix conecta sus XPU Raptor a la red NVLink de NVIDIA
IA

d-Matrix conecta sus XPU Raptor a la red NVLink de NVIDIA

El fabricante de aceleradores de inferencia adopta la arquitectura de rack MGX en vez de construir su propia infraestructura de escala completa.

NVIDIA Blog
d-Matrix adopta NVLink Fusion y armará racks de 144 Raptor
Electrónica

d-Matrix adopta NVLink Fusion y armará racks de 144 Raptor

La startup de inferencia se suma a Qualcomm, Arm, Marvell, Amazon, Fujitsu y MediaTek en licenciar la interconexión de Nvidia, y renuncia a diseñar su propia red de escalado vertical.

The Register
DeepSeek-V4.1-Flash: contexto de 1M y caché KV de 890 bytes
IA

DeepSeek-V4.1-Flash: contexto de 1M y caché KV de 890 bytes

El modelo abre pesos bajo licencia MIT y ataca el cuello de botella real de los agentes largos, que no es la generación sino el costo de guardar millones de tokens en memoria.

MarkTechPost
NVIDIA acelera hasta 5 veces el primer token al aislar el encoder
IA

NVIDIA acelera hasta 5 veces el primer token al aislar el encoder

La desagregación encode-prefill-decode separa el encoder de visión del resto de la inferencia y rinde en cargas con muchas imágenes, pero se vuelve contraproducente con salidas largas.

NVIDIA Developer
AWS ficha a Qualcomm por hasta 60.000 millones a 2036
Electrónica

AWS ficha a Qualcomm por hasta 60.000 millones a 2036

El acuerdo cubre silicio personalizado para inferencia y óptica de 1,6 Tbps, aunque ninguna de las dos compañías entregó detalles concretos sobre los chips involucrados.

The Register
Deepseek quiere 160.000 chips Huawei en Mongolia Interior
IA

Deepseek quiere 160.000 chips Huawei en Mongolia Interior

El centro de datos correría solo inferencia, no entrenamiento, y sería el mayor conjunto conocido de aceleradores Huawei, aunque la entrega completa tomaría más de un año.

The Decoder
Decodificación especulativa: cómo elegir el largo del borrador
IA

Decodificación especulativa: cómo elegir el largo del borrador

NVIDIA publica las reglas prácticas para decidir cuántos tokens adelantar y con qué mecanismo generarlos, sin perder precisión en la inferencia.

NVIDIA Developer
NVIDIA: cómo dimensionar GPU de inferencia sin sobregastar
IA

NVIDIA: cómo dimensionar GPU de inferencia sin sobregastar

La compañía publicó un marco de trabajo que ordena el cálculo alrededor del uso real de la carga, con cuatro escenarios de empresa y sus requisitos de memoria.

NVIDIA Developer
Agentes de voz: el presupuesto real de latencia es 700
IA

Agentes de voz: el presupuesto real de latencia es 700

El tiempo hasta el primer token es la métrica con la que los equipos eligen su API de inferencia, y también la que más los confunde: la síntesis no habla hasta recibir una cláusula completa.

MarkTechPost
Jalapeño, el chip de OpenAI, supera a Blackwell en trabajo por watt
IA

Jalapeño, el chip de OpenAI, supera a Blackwell en trabajo por watt

OpenAI publicó en Hot Chips 37 los primeros números de su chip de inferencia propio: entre 1,5 y 1,9 veces más trabajo por watt que los sistemas GB200 y GB300 de NVIDIA.

Latent Space
Qwen3.8-Flash-Next rinde 16.000 tokens por segundo en la GB300
IA

Qwen3.8-Flash-Next rinde 16.000 tokens por segundo en la GB300

Alibaba liberó los pesos del modelo como anticipo de la arquitectura Qwen4, y NVIDIA publicó su validación sobre el rack GB300 NVL72 con soporte desde el día cero.

NVIDIA Developer
High Bandwidth Flash: mucha capacidad, poco ancho de banda
Electrónica

High Bandwidth Flash: mucha capacidad, poco ancho de banda

OXMIQ Labs mostró en Hot Chips 2026 que la nueva memoria entrega 14 veces más capacidad que la HBM a costo similar, con apenas 0,6 veces su ancho de banda agregado.

Tom's Hardware
Nvidia y Cerebras venden un rendimiento que nadie verá en producción
Electrónica

Nvidia y Cerebras venden un rendimiento que nadie verá en producción

Las cifras que ambas compañías mostraron en Hot Chips corresponden a servir una sola petición a la vez, un escenario que ningún operador de inferencia sostiene si quiere ganar dinero.

The Register
Jalapeño: el primer chip de OpenAI rinde 1,9 veces por watt
Electrónica

Jalapeño: el primer chip de OpenAI rinde 1,9 veces por watt

La compañía midió su acelerador de inferencia contra sistemas comerciales en tres modelos de pesos abiertos y reporta hasta 4,1 veces más rendimiento en las cargas más interactivas.

Interesting Engineering
TensorRT Model Connect: de Hugging Face a C++ en dos comandos
IA

TensorRT Model Connect: de Hugging Face a C++ en dos comandos

NVIDIA liberó implementaciones de referencia para llevar modelos abiertos desde un identificador de Hugging Face hasta inferencia nativa en C++, sin PyTorch ni Python en producción.

NVIDIA Developer
Nvidia mide su Groq 3 LPU: 3.400 tokens por segundo
Electrónica

Nvidia mide su Groq 3 LPU: 3.400 tokens por segundo

Los primeros números independientes de los racks LPX llegan con una letra chica importante: la prueba corre sobre Gemma 4 31B, el mejor escenario posible para esta arquitectura.

The Register
Cerebras apilará DRAM sobre la oblea de su chip CS-6
Electrónica

Cerebras apilará DRAM sobre la oblea de su chip CS-6

En Hot Chips 2026 la compañía mostró el rack Nexus del CS-4, que duplica la potencia entregada a cada oblea, y adelantó dos generaciones completas de su hoja de ruta.

Tom's Hardware
Jalapeño por dentro: 64 núcleos, cada uno con su HBM4
Electrónica

Jalapeño por dentro: 64 núcleos, cada uno con su HBM4

OpenAI detalló en Hot Chips la arquitectura NUMA de su acelerador de inferencia: 216 GB de HBM4, dos redes internas separadas y más de la mitad del núcleo escrita con ayuda de sus propios modelos.

Tom's Hardware
Vera Rubin NVL72: hasta 30 veces más trabajo por megavatio
IA

Vera Rubin NVL72: hasta 30 veces más trabajo por megavatio

Nvidia midió sus nuevos sistemas contra el GB300 NVL72 usando trayectorias reales de sesiones de programación con agentes, aunque los resultados todavía esperan revisión de SemiAnalysis.

NVIDIA Blog
Jalapeño, el chip de OpenAI, supera a Blackwell y a Rubin
IA

Jalapeño, el chip de OpenAI, supera a Blackwell y a Rubin

El primer acelerador propio de OpenAI, hecho con Broadcom, se llevó los mejores números de rendimiento por watt en el banco de pruebas InferenceX, aunque no pasa de muestras de ingeniería.

The Decoder
Groq 3 LPX: 3.431 tokens por segundo y nada de HBM
Electrónica

Groq 3 LPX: 3.431 tokens por segundo y nada de HBM

Nvidia presentó en Hot Chips 2026 la arquitectura del rack que heredó de Groq y publicó su primer benchmark de terceros, medido por Artificial Analysis sobre Gemma 4 31B.

Tom's Hardware
Crescent Island: el acelerador de Intel para inferencia de 350 W
Electrónica

Crescent Island: el acelerador de Intel para inferencia de 350 W

La tarjeta PCIe refrigerada por aire monta hasta 480 GB de LPDDR5X y apuesta por cachés más grandes y motores XMX más profundos en lugar de perseguir el récord de potencia bruta.

Tom's Hardware
d-Matrix apila su acelerador sobre DRAM: 100 TB/s por tarjeta
Electrónica

d-Matrix apila su acelerador sobre DRAM: 100 TB/s por tarjeta

Raptor invierte el orden habitual del apilamiento 3D y deja el dado de cómputo arriba, pero la empresa aún no dice quién le fabrica la memoria a medida.

Tom's Hardware
Dynamo restaura la inferencia de un LLM en 7,3 segundos
IA

Dynamo restaura la inferencia de un LLM en 7,3 segundos

El motor sombra de NVIDIA mantiene una réplica ya inicializada en la misma GPU y comparte los pesos en memoria, con lo que el reinicio en frío de 283 segundos se vuelve innecesario.

NVIDIA Developer
Samsung LPDDR5X-PIM: 614 GB/s calculando en la memoria
Electrónica

Samsung LPDDR5X-PIM: 614 GB/s calculando en la memoria

La primera memoria de bajo consumo con lógica integrada multiplica por ocho el ancho de banda y rinde 3,01 veces más tokens por segundo en inferencia.

Tom's Hardware
Jetson Orin Nano 2: 78 TOPS y el doble de inferencia
Robótica

Jetson Orin Nano 2: 78 TOPS y el doble de inferencia

NVIDIA presentó su nuevo computador de entrada para IA de borde, que duplica el rendimiento del Orin Nano Super y consume 40% menos en modo de 15 watts.

The Robot Report
Jalapeño, el chip de OpenAI: 1,7 exaFLOPS y 27,5 TB de HBM4
Electrónica

Jalapeño, el chip de OpenAI: 1,7 exaFLOPS y 27,5 TB de HBM4

OpenAI mostró en Hot Chips su acelerador desarrollado con Broadcom, pensado solo para inferencia, con producción en volumen prevista para 2027.

The Register
NVIDIA comprime Nemotron 3.5 Lightning de 66 GB a 22 GB
IA

NVIDIA comprime Nemotron 3.5 Lightning de 66 GB a 22 GB

La destilación consciente de cuantización (QAD) permite llevar los pesos a 4 bits y triplicar el rendimiento sin perder la precisión del modelo original en BF16.

NVIDIA Developer
OpenAI lanza Ultrafast: GPT-5.6 Sol a 750 tokens por segundo
IA

OpenAI lanza Ultrafast: GPT-5.6 Sol a 750 tokens por segundo

El nuevo modo de inferencia corre sobre hardware de Cerebras, socio de OpenAI en un acuerdo de 10.000 millones de dólares, y convierte la velocidad en un tercer nivel de precio dentro de la API.

The Decoder
NVIDIA Rubin: 10x más rendimiento agentico por watt
IA

NVIDIA Rubin: 10x más rendimiento agentico por watt

La nueva GPU de la plataforma Vera Rubin apunta a las cargas de IA agentica con 336 mil millones de transistores, 288 GB de HBM4 y 50 petaflops en formato NVFP4.

NVIDIA Developer
Frozen v2: el chip de Google que graba Gemini en el silicio
IA

Frozen v2: el chip de Google que graba Gemini en el silicio

El chip, atribuido a Jeff Dean, grabaría el plano de Gemini en el hardware para ser 6 a 10 veces más eficiente que los TPU actuales. Google lo desplegaría desde 2028 para abaratar la inferencia.

The Decoder

Etiquetas relacionadas

Otros temas que aparecen junto a #inferencia en nuestra cobertura editorial.