IBM publicó sus modelos de lenguaje Granite 4.2 en tres tamaños: 3.000, 8.000 y 30.000 millones de parámetros. Entrenados desde cero sobre unos 15 billones de tokens, admiten ventanas de contexto de hasta 512.000 tokens y pueden alternar entre un modo de razonamiento y otro directo para controlar cuánto cómputo se gasta en cada tarea, según la compañía. Un modo de "esfuerzo bajo" ahorra recursos en las consultas simples.
¿Qué cambia respecto de la versión anterior?
Las variantes de 8.000 y 30.000 millones de parámetros pasan además por lo que IBM llama entrenamiento por refuerzo agéntico, donde los modelos aprenden a usar herramientas, escribir y ejecutar código y buscar en la web dentro de entornos aislados reales. Todos los modelos admiten llamadas a herramientas en formato OpenAI y funcionan sobre vLLM o SGLang.
| Tamaño | Parámetros | Entrenamiento por refuerzo agéntico |
|---|---|---|
| Granite 4.2 pequeño | 3.000 millones | no |
| Granite 4.2 mediano | 8.000 millones | sí |
| Granite 4.2 grande | 30.000 millones | sí |
En las pruebas publicadas por IBM sobre tareas agénticas y uso de herramientas, el modelo de 30.000 millones lidera en las tres evaluaciones.
La cifra de contexto merece una traducción práctica: 512.000 tokens equivalen aproximadamente a 380.000 palabras en inglés, del orden de una novela extensa o de un repositorio de código mediano completo. Es un tamaño que en la práctica saca del camino el trabajo de trocear documentos antes de consultarlos, al menos para la mayoría de los casos de uso corporativos.
Reconocimiento de voz en 470 millones de parámetros
IBM acompañó el lanzamiento con los modelos Granite Speech 5.0 Turbo CTC, que tienen apenas 470 millones de parámetros y, según la compañía, duplican la velocidad de los líderes anteriores en la tabla comparativa Open ASR Leaderboard. La cifra que ilustra el salto: transcriben tres horas de audio en un segundo.
Puesto en perspectiva, ese modelo de voz es unas 64 veces más pequeño que el Granite de 30.000 millones de parámetros, lo que lo deja dentro del rango de lo que corre en un equipo de escritorio corriente o incluso en hardware de borde con acelerador.
Todo bajo Apache 2.0
Todos los modelos están disponibles bajo licencia Apache 2.0 en Hugging Face, Ollama, GitHub y otras plataformas. Ese detalle no es menor y conviene subrayarlo, porque buena parte de los modelos que se anuncian como abiertos llegan en realidad con licencias propias que restringen el uso comercial, imponen umbrales de usuarios o prohíben entrenar otros modelos con sus salidas. Apache 2.0 es una licencia permisiva estándar: permite uso comercial, modificación, redistribución y trabajos derivados, con la sola obligación de conservar los avisos de atribución y de licencia.
Para un equipo en Chile o el resto de la región, la combinación de pesos abiertos bajo Apache 2.0 y compatibilidad con vLLM y SGLang significa que la versión de 3.000 millones de parámetros puede desplegarse sobre infraestructura propia sin negociar términos con nadie, y que el formato de llamadas a herramientas de OpenAI permite reutilizar el mismo código de integración que ya se haya escrito para otros proveedores.




