Un consorcio de investigación alemán coordinado por la KI Bundesverband (Asociación Alemana de IA) liberó Soofi S 30B-A3B, un modelo de lenguaje abierto que, según su reporte de preentrenamiento, alcanza los puntajes más altos en benchmarks de inglés y alemán entre los modelos completamente abiertos, superando a líderes previos como OLMo 3 32B y Apertus 70B.
Es uno de los primeros modelos grandes entrenados íntegramente en la Industrial AI Cloud de Deutsche Telekom en Múnich. Gracias a su arquitectura híbrida Mamba-Transformer, Soofi S mantiene el rendimiento incluso en contextos muy largos, mientras que modelos densos como Apertus 70B y Qwen3 32B caen bruscamente.
¿Cómo logra ser tan eficiente Soofi S?

Soofi S es un modelo de mezcla de expertos (mixture-of-experts). Contiene 31,6 mil millones de parámetros en total, pero activa solo unos 3,2 mil millones por token generado. Eso acerca su costo de cómputo al de un modelo de 3B más que al de uno convencional de 30B. El consorcio adopta sin modificaciones la arquitectura de Nemotron 3 Nano de Nvidia, un diseño híbrido que combina capas Mamba-2 con capas de atención estándar.
La diferencia clave frente a los transformers típicos está en el manejo de memoria. En los modelos convencionales, la caché KV que almacena los tokens previos para el cálculo de atención crece de forma lineal con la longitud del contexto. Con entradas largas y muchas solicitudes en paralelo, recargar esa caché se vuelve un cuello de botella. Solo 6 de las 52 capas de Soofi S mantienen esa caché.
El resultado práctico aparece en la velocidad de generación. Con un contexto de 40.000 tokens y 32 solicitudes en paralelo, Soofi S genera aproximadamente ocho veces más tokens por segundo por GPU que los modelos densos en el rango de 14 a 24 mil millones de parámetros. Mientras el rendimiento de los modelos convencionales cae al crecer el contexto, Soofi S se mantiene casi plano de 4.000 a 256.000 tokens. El único modelo con comportamiento similar en las mediciones es Qwen3.5 35B-A3B de Alibaba, que también usa arquitectura híbrida.
Un mix de entrenamiento construido en torno al alemán

El consorcio procesó cerca de 27 billones de tokens en total, repartidos en tres fases. En la primera, el modelo aprende fundamentos del lenguaje con unos 20 billones de tokens de una mezcla amplia de web, código, matemáticas y textos de dominio específico. Una segunda fase suma unos 6 billones de tokens de fuentes de mayor calidad. Una tercera fase, más corta, extiende la ventana de contexto entrenando con documentos muy largos de hasta un millón de tokens.
El foco deliberado en el alemán es central. En la primera fase, el alemán representa el 7,2 por ciento del mix de entrenamiento; en la segunda, esa proporción sube al 15,3 por ciento. En la receta de referencia Nemotron de Nvidia, todos los idiomas distintos del inglés combinados suman solo cerca del 5 por ciento.
Para las fuentes de datos, el consorcio combina texto web en alemán de HPLT, el corpus German Commons de licencia abierta, porciones alemanas de FinePDFs y FineWiki, y el corpus con licencia comercial Genios, que contiene 193 millones de artículos de prensa de 916 publicaciones alemanas.
¿Qué tan bueno es frente a otros modelos abiertos?
En evaluaciones contra otros 16 modelos abiertos, Soofi S lidera a todos los modelos completamente abiertos en puntajes agregados tanto de alemán como de inglés, según el reporte. Eso incluye a OLMo 3 32B del Allen Institute for AI y a Apertus 70B de ETH Zúrich y EPFL.
En benchmarks de código, Soofi S obtiene 73,8 por ciento en HumanEval, 70,2 en MBPP y 84,2 en la variante alemana German MBPP, los mejores resultados entre sus pares open source. En INCLUDE-DE, una prueba de conocimiento regional alemán, empata el primer lugar con 61,2 puntos junto al mayor Qwen3.5 35B-A3B. Comparado con la base Nemotron, la receta de datos en alemán mejora la competencia lingüística en 15,1 puntos y la prueba científica GPQA-Diamond en 9,6 puntos, sin sacrificar rendimiento en inglés.
No todo es liderazgo: Soofi S rinde peor en matemática de competencia en alemán, con 56 puntos en Minerva MATH-DE, lejos de Qwen3.5 35B-A3B (76,5) y Gemma 3 27B (65,6). También queda atrás en recuperación factual abierta en NaturalQuestions, algo que probablemente se relaciona con tener solo 3 mil millones de parámetros activos, que pueden almacenar menos conocimiento del mundo que un modelo denso de 27B.
Infraestructura soberana y apertura documentada
El entrenamiento se realizó entre marzo y mayo sobre hasta 512 GPU Nvidia B200 en la Industrial AI Cloud de Deutsche Telekom en Múnich, con un total aproximado de 253.000 horas-GPU. Según el reporte, la instalación funciona íntegramente con energía renovable, se enfría con agua del canal Eisbach y aporta calor residual al barrio Tucherpark.
Detrás de Soofi hay un consorcio de instituciones de investigación y empresas alemanas, financiado por el Ministerio Federal de Economía y Energía dentro del programa europeo IPCEI-CIS. Participan los institutos Fraunhofer IAIS e IIS, el centro DFKI, la TU Darmstadt, la Universidad de Wurzburg, el centro L3S, la Berlin University of Applied Sciences y las empresas de IA Ellamind y Merantix Momentum.
Los investigadores liberan los pesos del modelo junto a checkpoints intermedios seleccionados, el código completo de entrenamiento y evaluación, y un inventario detallado de datos. Según el equipo, esto hace que Soofi S cumpla la definición Open Source AI 1.0 de la Open Source Initiative. El reporte indica que cerca del 99 por ciento del mix de entrenamiento se puede reconstruir de forma independiente; la licencia exacta del modelo aún no está finalizada.
Contexto para LatAm
Un modelo con solo 3,2B parámetros activos y coste de cómputo cercano a un 3B abre una puerta concreta para la región: correr un modelo de calidad 30B en hardware modesto. Frente a los grandes pesos abiertos internacionales, Soofi S se posiciona como alternativa soberana europea. El foco en alemán no lo hace directamente útil para el español, pero su receta (datos regionales deliberados más arquitectura híbrida) es exactamente la que necesitaría un eventual modelo soberano en español para no depender de laboratorios estadounidenses.




