Saltar al contenido
Etiqueta

#inferencia local

8 notas publicadas

NVIDIA PAIR reparte la inferencia local entre varios PC
IA

NVIDIA PAIR reparte la inferencia local entre varios PC

El router virtual descubre los computadores de la red doméstica y distribuye entre ellos las peticiones independientes de un sistema multiagente, sin tocar el código del agente.

NVIDIA Developer
NVIDIA PAIR une los PC ociosos de la casa en un clúster de IA
IA

NVIDIA PAIR une los PC ociosos de la casa en un clúster de IA

El Personal AI Router es software libre, funciona con GeForce RTX 20 en adelante y también con chips Apple M4, y aprovecha los equipos mientras nadie los usa.

The Verge
Perplexity libera Lily: inferencia en Rust y Metal para Mac
IA

Perplexity libera Lily: inferencia en Rust y Metal para Mac

El motor detrás de Hybrid Compute corre Qwen3.6-35B-A3B sin PyTorch ni MLX en el camino de ejecución, con kernels Metal escritos a mano.

MarkTechPost
Lemonade 11.9 estrena el backend ROCm HRX de AMD
Open Source

Lemonade 11.9 estrena el backend ROCm HRX de AMD

El servidor local de IA respaldado por AMD suma soporte experimental de HRX sobre llama.cpp, con mejoras de 30% a 50% en la fase de prellenado frente a los backends Vulkan y HIP existentes.

Phoronix Tests
Qwen3.8 corre en un Mac Studio y erosiona el foso de los LLM
Electrónica

Qwen3.8 corre en un Mac Studio y erosiona el foso de los LLM

Las versiones cuantizadas del modelo abierto de 27.000 millones de parámetros funcionan en equipos de 32 GB de RAM, y hasta en uno de 16 GB con calidad degradada.

Hackaday
Intel LLM-Scaler ya corre Muse Glimmer 30B en las Arc Pro
Open Source

Intel LLM-Scaler ya corre Muse Glimmer 30B en las Arc Pro

Las nuevas versiones del stack en Docker de Intel suman soporte el mismo día del lanzamiento para el modelo de 30B de Meta, más generación de video local y mejoras de latencia en Gemma 4.

Phoronix Tests
ESP32-S3: un LLM de 28,9M de parámetros corre a 9 tokens/s
Electrónica

ESP32-S3: un LLM de 28,9M de parámetros corre a 9 tokens/s

El desarrollador Slava S. logró que un modelo de lenguaje completo se ejecute sin conexión en una placa de unos 8 dólares, apoyándose en la técnica de embeddings por capa de Google.

CNX Software

Etiquetas relacionadas

Otros temas que aparecen junto a #inferencia local en nuestra cobertura editorial.