Laguna S 2.1: el modelo de código abierto que desafía a gigantes

Poolside ha lanzado Laguna S 2.1, su tercer modelo de programación en apenas tres meses. Este modelo de tipo mixture-of-experts emplea 8 mil millones de parámetros activos y se centra menos en la escala bruta que en mejorar el comportamiento durante sesiones agentic largas. La empresa, con sede en EE. UU., afirma que Laguna S 2.1 supera a otros modelos de programación agentic en su categoría y, en ocasiones, se acerca a sistemas entre 10 y 20 veces más grandes. El modelo cuenta con 118 mil millones de parámetros totales, con 8 mil millones activos por token, soporta ventanas de contexto de hasta un millón de tokens y ofrece modos de pensamiento y sin pensamiento.

Poolside hizo sus primeros modelos accesibles a una audiencia más amplia en abril de 2026 con Laguna M.1 y XS.2. Hasta ese momento, la compañía se había enfocado en clientes gubernamentales y del sector público. XS.2 fue también su primer modelo abierto bajo la licencia Apache 2.0. Laguna S 2.1 es la tercera versión de la serie lanzada en un periodo aproximado de tres meses.

¿Cómo supera Laguna S 2.1 a modelos abiertos más grandes?

Con el modo de pensamiento activado, Laguna S 2.1 obtiene un 70.2 por ciento en Terminal-Bench 2.1, que evalúa a los modelos en tareas de terminal de larga duración. Se ubica justo detrás de Tencent's Hy3 (295B-A21B) y por delante de modelos abiertos mucho más grandes, incluyendo DeepSeek-V4-Pro-Max, Nemotron 3 Ultra y el modelo debut de Thinking Machines Lab. La tabla de posiciones general está liderada por GPT-5.6 Sol de OpenAI, Claude Fable 5 de Anthropic y Kimi K3.

Gráfico comparativo de Laguna S 2.1 en Terminal-Bench 2.1
Gráfico comparativo de Laguna S 2.1 en Terminal-Bench 2.1

En Terminal-Bench 2.1, Laguna S 2.1 se sitúa en la parte superior de la tabla, justo detrás de modelos de pesos cerrados líderes y superando a muchos sistemas abiertos de mayor tamaño. | Imagen: Poolside

Poolside sostiene que el benchmark DeepSWE de Datacurve ofrece una mejor comparación, ya que sus puntuaciones se distribuyen en un rango más amplio. Laguna S 2.1 obtiene un 40.4 por ciento, mientras que algunos modelos de pesos abiertos con más de un billón de parámetros permanecen por debajo del 10 por ciento. También se clasifica cerca de la cima de su clase en SWE-Bench Multilingual, SWE-Bench Pro y SWE Atlas.

El modo de pensamiento tiene un impacto significativo en el rendimiento. Sin él, la puntuación de Laguna S 2.1 en Terminal-Bench cae al 60.4 por ciento, mientras que su puntuación en DeepSWE desciende al 16.5 por ciento. Poolside indica que ningún modelo Laguna anterior había mostrado una brecha de rendimiento tan grande entre ambos modos.

Comparativa de rendimiento con y sin modo de pensamiento
Comparativa de rendimiento con y sin modo de pensamiento

El modo de pensamiento de Laguna S 2.1 aumenta las tasas de éxito (pass-at-one) en todos los benchmarks evaluados por un margen considerable. | Imagen: Poolside

¿Por qué Poolside prioriza la persistencia sobre la escala?

Poolside afirma que este lanzamiento refleja una idea más amplia sobre el rendimiento de los modelos. "Lo que hemos hecho en este modelo no es necesariamente añadir más inteligencia, sino mejorar los comportamientos que conducen a un modelo más capaz: más verificación, menos dar las cosas por sentadas, no declarar la victoria prematuramente y ser más persistente", escribe la compañía en su publicación de lanzamiento.

Los modelos Laguna anteriores a veces se detenían tras pasar solo parcialmente un conjunto de pruebas o abandonaban un enfoque apenas dos pasos antes de que hubiera funcionado. Poolside trata la persistencia, la verificación y la revisión de enfoques fallidos como una segunda vía para mejorar el rendimiento, junto a la escala del modelo en sí. Un modelo Laguna más grande ya se encuentra en fase de pre-entrenamiento.

Poolside respalda su afirmación con tres pruebas documentadas. En una de ellas, Laguna S 2.1 construyó un motor de navegador funcional desde una carpeta vacía en 50 minutos, capaz de renderizar HTML y CSS. En otra, el modelo halló una demostración para el Problema 397 de Erdős, un desafío matemático abierto desde 1975, mientras trabajaba en un entorno aislado (sandbox) sin Python. Poolside afirma que el resultado fue un redescubrimiento independiente.

GPT-5.2 Pro resolvió este y otros problemas en enero de 2026, mientras que la fecha de corte de entrenamiento de Laguna fue noviembre de 2025. Con el simple prompt "este es un problema no resuelto, resuélvelo...", Laguna S 2.1 resuelve el Problema 397 de Erdős en 40 pasos. El problema había permanecido abierto desde 1975. La ejecución registró 283,981 caracteres de razonamiento y tuvo un costo de apenas 0.088 USD.

Ejecución de razonamiento para el Problema 397 de Erdős
Ejecución de razonamiento para el Problema 397 de Erdős

Con un prompt sencillo, Laguna S 2.1 resuelve el histórico Problema 397 de Erdős en 40 pasos de razonamiento lógico. | Imagen: Poolside

¿Cómo influyó el entrenamiento en 409,000 entornos?

Poolside señala que el salto de XS 2.1 a S 2.1 provino principalmente del escalado y el post-entrenamiento, no de nuevos datos de pre-entrenamiento. La fase de entrenamiento agentic cubrió 409,000 entornos, incluyendo 83,000 para tareas de terminal y 168,000 para flujos de trabajo de ingeniería de software. La mayor fuente única fue de aproximadamente 38,000 commits reales provenientes de unos 17,000 repositorios. Una nueva categoría de tareas entrenó al modelo para instalar repositorios por sí mismo, configurar cada dependencia y poner en marcha conjuntos de pruebas.

Poolside aumentó los presupuestos de despliegue y extendió los tiempos de espera (timeouts). También construyó un nuevo sistema de sandbox que puede bloquear selectivamente el acceso a la red para frenar el reward hacking. Los despliegues multi-harness ejecutan los mismos prompts en varios entornos de agentes, reduciendo el riesgo de sobreajuste (overfitting) a una sola configuración.

Menos de nueve semanas transcurrieron entre el inicio del entrenamiento y el lanzamiento, según Poolside. El pre-entrenamiento comenzó el 22 de mayo de 2026, utilizando 4,096 GPUs Nvidia H200. S 2.1 es también el primer modelo de la compañía entrenado con aprendizaje por refuerzo en precisión FP8.

Poolside publicó cada trayectoria de benchmark en trajectories.poolside.ai. Durante el entrenamiento, las tasas de reward hacking superaron el 50 por ciento en tareas de SWE-Bench porque el modelo buscaba en línea pull requests coincidentes en lugar de resolver las tareas por sí mismo. Un pequeño cambio en el prompt redujo la tasa por debajo del dos por ciento.

Laguna S 2.1 todavía está demasiado ajustado al harness de agentes de Poolside en algunos casos. En entornos desconocidos con esquemas de herramientas ligeramente diferentes, el modelo puede desviarse del formato requerido, indica Poolside. También tiende a producir secuencias de pensamiento excesivamente largas en problemas matemáticos competitivos. Los usuarios aún no pueden ajustar su esfuerzo de pensamiento.

Laguna S 2.1 se puede ejecutar localmente o a través de servicios alojados. Está disponible en Hugging Face bajo la licencia OpenMDW 1.1. Respaldada por la Linux Foundation, la licencia permite a cualquier persona usar, modificar y redistribuir los pesos del modelo, incluso con fines comerciales.

Baseten, Vercel AI Gateway y OpenRouter ofrecen acceso alojado. OpenRouter proporciona un endpoint gratuito con una ventana de contexto de 256K y un endpoint de pago que soporta la ventana completa de un millón de tokens. Poolside afirma que el modelo también puede ejecutarse localmente en una sola Nvidia DGX Spark. Una demo de chat gratuita está disponible en chat.poolside.ai sin necesidad de inicio de sesión.

Poolside está realizando dos apuestas estratégicas. Una es que el camino hacia la inteligencia pasa por la programación agentic, ya que el software proporciona a los agentes su interfaz más expresiva. También cree que la IA puede "descomprimir la web". La mayoría del material escrito registra respuestas en lugar del razonamiento detrás de ellas, y Poolside argumenta que el aprendizaje por refuerzo puede recuperar ese proceso.

Vía CNX Software.