La competencia entre los laboratorios de frontera y la potencia creciente de los modelos de pesos abiertos como Kimi K3 y Qwen3.8-Max convirtieron al enrutamiento de modelos en una pieza central del despliegue de IA. La señal más visible fue la compra de OpenRouter por parte de Stripe por más de 7.000 millones de dólares, pero la tendencia corre igual de fuerte dentro de las empresas.

Glean, cofundada y dirigida por el exingeniero distinguido de Google Arvind Jain, se especializa en llevar IA a organizaciones grandes. Su última valoración fue de 7.200 millones de dólares tras una ronda Serie F de 150 millones en junio pasado. Este año alcanzó 300 millones de dólares en ingresos recurrentes anuales, el triple en apenas 15 meses.

Parte de la misión de Glean es decidir qué modelo usar en cada tarea, o incluso si hace falta un modelo de lenguaje.

"Un objetivo importante de Glean es evitar usar modelos de lenguaje en tareas donde no los necesitamos", dijo Jain a Latent Space. "A veces ves consultas en Glean donde la gente está sumando dos números o multiplicándolos. Podrían haber usado una calculadora para eso".

¿Cómo funciona el enrutamiento en la práctica?

Glean ofrece tres niveles de selección de modelo:

  • Los empleados pueden elegir un modelo de forma explícita.
  • Los administradores pueden restringir modelos o imponer límites de uso.
  • El modo automático selecciona dinámicamente un modelo para cada tarea.
Configuración de modelos para determinadas tareas en Glean
Configuración de modelos para determinadas tareas en Glean

El modo automático es el que eligen mayoritariamente los clientes, y la razón es económica.

"¿Por qué la gente habla de enrutamiento de modelos? ¿Por qué está entusiasmada? Es sobre todo por el costo", explicó Jain.

Tony Gentilcore, otro cofundador y líder de ingeniería, afirmó recientemente que Glean es cuatro veces más eficiente en costo que Claude Code, con un promedio de 0,45 dólares por tarea frente a 1,84 dólares en Claude Cowork. Lo atribuyó al arnés y a las capacidades de enrutamiento de la compañía.

La aritmética que explica la urgencia es simple. Para una persona, una suscripción de 20, 100 o 200 dólares mensuales rinde. Para una empresa, el costo por usuario se dispara.

"Los modelos de IA se han encarecido", dijo Jain. "Si miras Opus o los últimos modelos de GPT, los más avanzados, no solo son muy potentes: pueden ejecutar tareas mucho más complejas que los anteriores. Pero por token son más caros, a veces el doble o el cuádruple que los modelos previos. Y los usuarios los usan para tareas mucho más largas. Así que estás gastando 10 o 20 veces más por usuario que el año pasado".

La ventaja que no se compra: ver cómo se usa la IA

El segundo factor detrás del ascenso de Glean es que observa cómo usan la IA los trabajadores comunes. El producto se despliega a toda la planilla y también sirve para construir agentes en cada departamento.

Entre sus clientes, Zillow reporta 80% de adopción entre 7.000 empleados, y en Booking.com Glean fue la primera plataforma de IA adoptada a nivel de toda la compañía.

"Estamos observando lo que la gente hace realmente con IA sobre una base muy amplia", dijo Jain. "Vemos, ante distintos tipos de tareas, qué modelos eligen primero y cuándo, al no quedar satisfechos, escalan a otro modelo que sí les da el resultado correcto".

Ese circuito de retroalimentación humana, a escala, alimenta el sistema de enrutamiento.

Waldo, o el arte de no gastar tokens

Sobre los modelos de lenguaje, Glean puso una capa propia llamada Waldo, presentada en abril como su primer modelo de búsqueda agéntica.

Glean afirma que Waldo reduce la latencia 50% y los tokens 25%, reservando los modelos avanzados para el trabajo que los requiere
Glean afirma que Waldo reduce la latencia 50% y los tokens 25%, reservando los modelos avanzados para el trabajo que los requiere

En una publicación técnica, Waldo aparece como un proceso de filtrado: decide cómo descomponer la pregunta, qué herramientas usar, qué leer a continuación y cuándo tiene evidencia suficiente para pasarle el trabajo a un modelo de frontera.

Eso significa que el enrutamiento ocurre después de que Glean reunió lo que Jain llama las materias primas de la tarea. "Podemos ensamblar las materias primas necesarias para hacer el trabajo sin quemar tokens", agregó. El corolario es incómodo para la carrera de parámetros: un modelo barato con buen contexto puede rendir más que uno de frontera cargado de datos irrelevantes.

¿Qué cambió con los modelos de pesos abiertos?

Jain confirmó que hay ahora interés real de las empresas en modelos de pesos abiertos, y que el giro ocurrió en cuestión de meses.

"El año pasado el uso era minúsculo y nadie consideraba en serio el código abierto", dijo, en parte por el estigma de que muchos de esos modelos se desarrollan fuera de Estados Unidos.

Publicación de Arvind Jain del 27 de julio de 2026 en apoyo a los modelos de pesos abiertos
Publicación de Arvind Jain del 27 de julio de 2026 en apoyo a los modelos de pesos abiertos

"En los últimos tres meses, porque la IA se puso tan cara, a las empresas les resultó insostenible mantener estas inversiones", dijo Jain. "Dado que el código abierto es un orden de magnitud más barato para ejecutar tareas, se generó mucho interés. Hoy puedo decir que en la mayoría de las empresas los modelos abiertos son parte clave de la estrategia de IA".

Y agregó una frase que resume el estado del mercado: "Ya nadie está dispuesto a depender de un solo proveedor de modelos, ni de dos, y nadie cree que puede sobrevivir sin código abierto".

Para la región, ese cambio tiene una lectura directa. Un orden de magnitud de diferencia en costo por tarea es exactamente la brecha que separa un despliegue corporativo viable de uno inviable cuando el presupuesto de TI está en pesos y la factura de tokens en dólares.

Cómo se mide si el enrutador acertó

Glean mantiene sistemas internos de prueba donde compara cargas de trabajo reales, por clase de consulta, contra alternativas. Deja que el enrutador elija una ruta y en paralelo intenta la misma tarea con modelos algo más baratos y algo más caros.

Cómo Glean monitorea la calidad de sus respuestas
Cómo Glean monitorea la calidad de sus respuestas

Después usa jueces basados en IA para determinar qué tan certero fue el enrutador. "Hay un aprendizaje continuo que se actualiza con tráfico real nuevo: dejas que el enrutador haga el trabajo para el usuario, pero detrás corres la misma tarea", explicó. Eso se aplica solo a una fracción pequeña del uso real, aunque a la escala de Glean alcanza de sobra.

La compañía fue fundada a comienzos de 2019 para atacar la búsqueda empresarial, y Jain la describe como la primera en trabajar con transformers y modelos de lenguaje para empresas. Siete años después, el foco ya no es buscar documentos.

La función de respuestas de Glean toma la información directamente de la documentación de la organización
La función de respuestas de Glean toma la información directamente de la documentación de la organización

Jain cerró la conversación definiendo a Glean como una plataforma de IA de punta a punta usada de forma intensiva por sus clientes empresariales. Eso, dijo, es lo que le entrega los datos necesarios para enrutar modelos de manera efectiva.