OpenBMB liberó MiniCPM5-2B, el segundo punto de control de la serie MiniCPM5 y el sucesor de MiniCPM5-1B. Es un modelo de lenguaje causal denso con 2.516.756.480 parámetros, de los cuales 1.981.982.720 quedan fuera de los embeddings. Usa 42 capas, atención de consultas agrupadas con 16 cabezales de consulta y 2 de clave-valor, y una ventana de contexto nativa de 131.072 tokens.
La arquitectura es un LlamaForCausalLM estándar, así que los motores de inferencia habituales lo cargan sin kernels a medida y sin bifurcar el código del modelo.
¿Se puede desplegar hoy?
Sí. Los pesos salen con licencia Apache 2.0 y corren sobre vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX y FlagOS.
Ese detalle pesa más de lo que parece para quien trabaja con hardware local. A 4 bits por parámetro, los pesos de un modelo denso de 2,52B ocupan cerca de 1,3 GB, un tamaño que entra sin apuro en un teléfono de gama media, en un mini PC o en una placa tipo Jetson Orin Nano. No es un modelo que exija una GPU de centro de datos.
Qué muestra realmente la tabla de pruebas
OpenBMB compara MiniCPM5-2B contra LFM2.5-2.6B, Qwen3.5-2B y Gemma-4-E2B-it dentro de la misma clase de tamaño, y suma como referencia a Qwen3.5-4B, granite-4.2-3B, Nemotron-3-Nano-4B, Gemma-4-E4B-it y LFM2.5-8B-A1B. A lo largo de 34 filas promedia 53,9. El mejor de ese conjunto es Qwen3.5-4B con 51,1, seguido por granite-4.2-3B con 42,7 y LFM2.5-2.6B con 33,2.
En razonamiento sobre código anota 69,1 en LiveCodeBench v6 frente a 56,4, y 46,4 en SWE-bench Verified frente a 33,6. El uso de herramientas es donde saca la ventaja más amplia: 97,1 en τ²-Bench Telecom, 66,6 en BFCL v4 y 20,8 en τ³-Bench Banking frente a 6,8.
El contexto largo queda dividido: 68,1 en NoLiMa frente a 43,5, pero 59,0 en AA-LCR frente a 61,0 y 43,7 en LongBench v2 frente a 47,3. El conocimiento general es donde se nota la brecha de tamaño: 70,8 en MMLU-Pro frente a 78,0, y 8,9 en Humanity's Last Exam frente a 9,9. OpenBMB marca por separado las filas tomadas de Artificial Analysis y las que reprodujo internamente.
Receta de entrenamiento: SFT, después RL y destilación
El entrenamiento sigue el método de gestión de datos por niveles UltraData, descrito en la investigación original. El entrenamiento base corre fases estables y de decaimiento, y luego una etapa intermedia adapta el modelo a la distribución de datos objetivo. El post-entrenamiento parte con 400.000 millones de tokens de ajuste supervisado de pensamiento profundo, y después entrena profesores de aprendizaje por refuerzo especializados en matemáticas, código, tareas agénticas y escritura, con el algoritmo JustRL II basado en crítico.
El paso final es la destilación on-policy, que fusiona 16 expertos de refuerzo, cinco de ellos agénticos, en un único modelo despachado. En cada posición de la respuesta calcula la divergencia KL inversa sobre el vocabulario completo entre los logits del estudiante y los del profesor como estimación de la ventaja, en reemplazo de la ventaja basada en verificación. Reutiliza los prompts de refuerzo como datos de destilación, así que no construye un corpus nuevo. OpenBMB mide esa etapa combinada en 10,96 puntos promedio en pruebas de razonamiento y generales, y 6,96 puntos en las agénticas.
Los datos también son abiertos
Junto con los pesos, OpenBMB publicó Ultra-FineWeb, Ultra-FineWeb-L3, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-2605, UltraData-SFT-Agent-2609 con 500.000 muestras de agentes, y UltraData-RL-2609 con más de 80.000 muestras de refuerzo. También liberó los puntos de control intermedios, que cubren las versiones Base, Midtrain y solo-SFT, de modo que el aporte de cada etapa se puede medir directamente.
¿Para qué sirve y para qué no?
MiniCPM5-2B es una opción creíble para cargas agénticas y de llamada a herramientas en el dispositivo, no un modelo de conocimiento general. Su ventaja se ve más nítida en uso de herramientas, agentes de programación y recuperación de contexto largo al estilo NoLiMa, y queda por debajo de modelos más grandes en MMLU-Pro, GPQA-Diamond y MATH-500.
La apertura de los datos y de los puntos de control intermedios permite verificar la afirmación sobre refuerzo más destilación, y eso pesa más que el promedio del titular.




