Inherent, un laboratorio de IA con sede en Londres fundado por exintegrantes de Google DeepMind, asegura que su agente acaba de superar a modelos mucho más grandes de Anthropic y OpenAI usando una fracción del tamaño.

De todas las empresas emergentes fundadas por exintegrantes de Google DeepMind, Inherent ha recibido relativamente poca atención. Pero mientras rivales mejor financiados todavía no le muestran al mundo nada concreto, el equipo londinense empezó a compartir lo que ha estado construyendo.

A solo semanas de salir del sigilo con una ronda semilla de 50 millones de dólares, la empresa británica afirma que su agente recién liberado, Faraday, superó a modelos más grandes y más conocidos en una tarea específica: reproducir de manera independiente los hallazgos de artículos científicos publicados, sin que se le diera la respuesta por adelantado.

¿Por qué replicar estudios y no descubrir cosas nuevas?

Puede sonar a truco de salón, considerando el objetivo bastante más ambicioso de Inherent, que es construir una IA capaz de descubrir conocimiento científico nuevo y no solo verificar resultados viejos. Pero la replicación de artículos también es un ejercicio de formación estándar para los científicos humanos, según señaló Edward Hughes, cofundador y científico jefe. "Muchos estudiantes de doctorado en realidad empiezan haciendo esto."

Ganarle a otros sistemas de IA en la tarea no era el punto, dijo Hughes a TechCrunch; el punto era cómo llegaron ahí.

"Lo que más nos interesó de esto no fue tanto el resultado de superar a esos agentes de frontera, que por supuesto nos gustó, sino la manera en que fuimos construyendo esto", explicó.

Acá viene la parte que debería llamar la atención de un inversionista: medido contra el Claude Opus 4.8 de Anthropic y el GPT-5.5 de OpenAI, ambos sistemas de escala de frontera y mucho más grandes, Faraday corre sobre un modelo comparativamente diminuto llamado Qwen 3.6, de apenas 27 mil millones de parámetros. A grandes rasgos, la cantidad de parámetros funciona como aproximación del tamaño de un modelo y, típicamente, también de su costo de entrenamiento.

SistemaEscalaResultado en replicación
Faraday (sobre Qwen 3.6)27 mil millones de parámetrosEl mejor del grupo, según Inherent
Claude Opus 4.8Escala de fronteraSuperado por Faraday
GPT-5.5Escala de fronteraSuperado por Faraday

¿Cómo se le enseña "criterio" a un agente?

La vara de éxito de Inherent era además más alta que la simple precisión. Más allá de replicar resultados, la empresa quería que Faraday demostrara criterio de investigación, un instinto para saber qué experimentos vale la pena correr y cómo diseñarlos bien.

Enseñar algo tan intangible como el criterio es difícil, y ahí entra el aprendizaje por refuerzo, un método de entrenamiento que recompensa a un sistema de IA por buenos resultados en lugar de deletrearle reglas a seguir. En vez de entrenar a sus agentes principalmente sobre el estudio de cómo se hace ciencia, Inherent se apoya en ese enfoque basado en recompensas, apostando a que generalizará mejor hacia su meta de largo plazo: agentes capaces de aportar en muchos campos científicos.

"Siempre nos guía esa estrella polar de construir un agente científico e imbuir a nuestros agentes de criterio", dijo Hughes.

Ese foco también determinó lo que Inherent decide no construir. En lugar de desarrollar su propia herramienta de programación, hizo que Faraday usara GPT-5.5 Codex de OpenAI, de la misma manera en que los científicos humanos se apoyan en software existente en vez de construirlo todo por su cuenta, según la compañía.

La empresa también intenta evitar agentes que simplemente le digan al usuario lo que quiere escuchar. El objetivo, según Hughes, está modelado sobre su tipo favorito de compañero de equipo: el que vuelve y dice "me dio curiosidad esto, fui y corrí estos experimentos. ¿Qué te parecen los resultados?".

Una empresa de doce personas en King's Cross

Ese instinto colaborativo se extiende a cómo opera Inherent como empresa. Su docena de empleados trabaja de manera presencial en una oficina en King's Cross, el barrio londinense antaño venido a menos que la presencia de Google DeepMind ayudó a convertir en uno de los principales polos de IA del mundo. "Creemos que Londres es el lugar donde hay que estar", afirmó Hughes.

Hughes es optimista respecto de la densidad de talento de IA en Londres, pero también sumó su voz a los llamados a terminar con el garden leave, la práctica común en el Reino Unido de impedir que un empleado que renuncia se sume a una empresa rival, o funde una, durante meses después de irse. Es una restricción que los investigadores estadounidenses en general no enfrentan, lo que da a las empresas emergentes de Estados Unidos una ventaja de partida para contratar talento que dejó un puesto anterior.

"Esta es una opinión personal más que una postura de la empresa, pero a mí me afectó el problema del garden leave", contó a TechCrunch.

Hughes terminó sorteando esa restricción y fundó Inherent junto a otros dos exintegrantes de DeepMind y un cuarto cofundador. Los fundadores son Louis Kirsch, Kaloyan Aleksiev, Tantum Collins y el propio Hughes. La empresa no piensa frenar: planea crecer su dotación a "entre 20 y 25" personas para fin de año. Dadas sus ambiciones también en modelos de mundo, y con el nuevo rol de Demis Hassabis dejando inquieto a parte del personal de DeepMind, ese empuje de contratación podría convertir a Inherent en un destino atractivo para quienes evalúen moverse.

¿Qué se puede sacar de esto desde LatAm?

El dato accionable es el tamaño. Un modelo abierto de 27 mil millones de parámetros cabe, cuantizado, en una sola GPU de centro de datos de gama media, y el resultado de Inherent sugiere que la diferencia no la hace el modelo base sino el entrenamiento por refuerzo aplicado encima. Eso cambia la ecuación para grupos de investigación universitarios de la región, que no pueden competir en cómputo de preentrenamiento pero sí pueden especializar un modelo abierto en un dominio acotado.

El segundo punto es metodológico y no requiere presupuesto: la replicación de artículos publicados es una tarea con respuesta verificable, lo que la vuelve un banco de pruebas honesto. Cualquier laboratorio puede armar ese mismo tipo de evaluación con literatura de su propia disciplina, sin depender de rankings generales que rara vez reflejan el trabajo real.