Lemonade 11.9 se publicó como la versión más reciente de este servidor local de IA de código abierto, respaldado por AMD y disponible para Linux, Windows y macOS. El proyecto lleva tiempo enfocado en ofrecer un uso de IA "100% gratuito y privado" con hardware local, sea con GPU, CPU o NPU.

Lo interesante de esta entrega es el soporte experimental del backend ROCm HRX junto a llama.cpp, funcionando con el runtime HRX de AMD e inicialmente para las GPU Radeon RX 7900 con arquitectura RDNA3 y para las APU Strix Halo.

¿Qué es HRX y por qué importa?

HRX es un desarrollo nuevo dentro del ecosistema ROCm y forma parte de los esfuerzos Loom y Hyperloom que AMD anunció en su evento Advancing AI en San Francisco, orientados a optimizar cargas de trabajo con agentes. HRX pertenece a la pila del compilador Loom y su representación intermedia, planteada como alternativa a la representación LLVM que la compañía usa desde hace años, con el objetivo de llevar el código generado más rápido al ensamblador optimizado de AMDGPU.

Además, es un componente común para lograr integración de alto rendimiento a través de todas las GPU, NPU y CPU de la marca. El repositorio hrx-system en GitHub lo explica así:

"El sistema HRX es una colección de componentes mínimos de runtime que entrega una implementación alternativa de HIP tal como se despacha hoy dentro de ROCm. Provee un sustrato común para integración de baja latencia y alto rendimiento con los productos de GPU, NPU y CPU de AMD."

El movimiento recuerda a la largamente comentada pila unificada de software de IA de AMD y a las discusiones previas sobre MLIR y SPIR-V como representación intermedia común preferida. Ahora entra en la ecuación Loom IR, una representación propia y más ajustada al hardware de la compañía.

¿Qué gana llama.cpp con esto?

Los detalles de HRX en el contexto de llama.cpp aparecieron en las últimas dos semanas en este hilo de discusión de GGML, abierto por la ingeniera de AMD Stella Laurenzo. En el mensaje inicial explicó el diagnóstico interno:

"En AMD estamos optimizando activamente el rendimiento de las GPU AMD en llama.cpp bajo los backends existentes de Vulkan y HIP. Sin embargo, a medida que ROCm madura en sistemas de cliente, nos hemos topado repetidamente con el costo de no tener backends nativos ni bibliotecas de cliente optimizadas que puedan afinarse de forma independiente para el mejor rendimiento posible de las GPU y NPU de nuestro silicio. Además, como ROCm se desarrolló en su origen principalmente para el mercado de centros de datos, suele enfrentar dificultades al integrarse y desplegarse en sistemas operativos de cliente."

La contribución inicial es deliberadamente acotada: una biblioteca mínima de kernels suficiente para ejecutar con buen rendimiento el modelo Qwen3-30B-A3B-Instruct en formato Q4_K_M sobre RDNA3 (W7900) y RDNA3.5 (Strix Halo). El equipo seguirá desarrollando la rama para ampliar la cobertura de modelos, sistemas operativos y equipos.

Las cifras que se manejan en ese hilo son concretas:

  • Entre 30% y 50% más tokens por segundo en la fase de prellenado, comparado con los backends Vulkan y HIP actuales de llama.cpp
  • Desde paridad hasta 10% de mejora en tareas de decodificación sin predicción multitoken
  • Una pila más simple de desarrollar y mantener que la ruta actual

¿En qué hardware corre hoy?

El backend experimental llamacpp-hrx de Lemonade 11.9 funciona sobre los objetivos de GPU GFX1100 y GFX1151 bajo Linux, es decir la generación Radeon RX 7900 y las APU Strix Halo. La expectativa es que el soporte de GPU se amplíe pronto. La versión también incorpora soporte de Qwen3-Next en el backend de llama.cpp que trae fijado, además de otras mejoras menores.

ElementoEstado en Lemonade 11.9
Backend llamacpp-hrxExperimental, solo Linux
GPU soportadasGFX1100 (RX 7900) y GFX1151 (Strix Halo)
Mejora en prellenado30% a 50% sobre Vulkan y HIP
Modelo de referenciaQwen3-30B-A3B-Instruct Q4_K_M

ROCm HRX resulta muy atractivo desde lo técnico, aunque, como apunta Phoronix, idealmente habría aparecido años atrás y no recién en estado experimental durante el segundo semestre de 2026.

Para quien arma equipos de inferencia local en la región, el dato práctico está en el par GFX1100 y GFX1151. Las APU Strix Halo son justamente la plataforma que hace atractivo correr modelos medianos sin GPU dedicada, gracias a su memoria unificada, y son también el hardware donde la brecha de software de AMD frente a CUDA se sentía con más fuerza. Si HRX cierra esa brecha, cambia el cálculo de costo por token de un servidor casero.