Andrew Ho deja OpenAI: El escalamiento ya no es suficiente

Andrew Ho abandona OpenAI tras solo ocho meses de trabajo, convencido de que los modelos de lenguaje (LLM) actuales generalizan deficientemente. Incluso en áreas con alta inversión como la programación, Ho sostiene que su rendimiento es inconsistente y poco fiable.

La causa raíz, según Ho, es la carencia de datos de entrenamiento adecuados. La mayoría de las habilidades con valor económico real apenas están representadas en los datasets existentes. "La mayor parte del trabajo es altamente contextual y no se puede codificar fácilmente en un entorno calificable; incluso si observamos un 'camino dorado' tomado por un humano, es difícil determinar si caminos contrafácticos alternativos producen resultados positivos o negativos", escribe Ho.

El escalamiento por sí solo no resolverá este problema, argumenta, y prevé que los laboratorios de IA deberán gastar más de USD 100.000 millones en recolección de datos específicos en los próximos años. Ho también se muestra escéptico ante las valoraciones astronómicas de laboratorios como OpenAI o Anthropic, las cuales considera crónicamente no rentables, ya que deben inyectar sumas crecientes en nuevos modelos solo para mantenerse por delante de competidores más económicos como Qwen o Kimi.

Sus primeros productos se enfocan en dos áreas. La primera son datasets para análisis científicos complejos en bioinformática, donde incluso modelos actuales como GPT-5.6 Sol alcanzan solo un 30 por ciento de tasa de éxito, un área en la que trabajó en OpenAI. La segunda son datasets para trabajo de laboratorio cotidiano, como cuando investigadores envían fotos de experimentos a modelos de IA para su evaluación. Se planea extender esto a química, ciencia de materiales, salud y otros campos del conocimiento.

¿Por qué los modelos pierden versatilidad al crecer?

El investigador de Cambridge, Adam Hunt, comparte el escepticismo de Ho. Hunt describe cómo su propia visión sobre los LLMs ha pasado de ser optimista a cada vez más pesimista. Su argumento es que los modelos más recientes no se están volviendo más versátiles, sino más especializados. Las capacidades de programación y matemáticas complejas siguen mejorando, mientras que áreas como la calidad del lenguaje y la lógica simple se estancan o incluso empeoran, lo que coincide con la observación de Ho sobre el rendimiento desigual.

Diagrama que compara la mejora gradual versus la especialización extrema donde algunas habilidades crecen mientras otras se estancan
Diagrama que compara la mejora gradual versus la especialización extrema donde algunas habilidades crecen mientras otras se estancan

La imagen superior muestra dos caminos de desarrollo de IA: una mejora gradual y amplia en todas las tareas frente a una especialización extrema donde pocas capacidades aumentan mientras las habilidades centrales se estancan o reducen.

La razón, dice Hunt, es que el aprendizaje por refuerzo (reinforcement learning) funciona bien en dominios como el código porque existen señales de recompensa claras y datos de entrenamiento completos. En otras áreas, esos datos simplemente no están disponibles. El progreso inicial de los modelos de lenguaje y su aparente capacidad de generalizar mediante el simple escalamiento y razonamiento fue un efecto secundario de entrenar sobre un corpus de texto amplio. No fue una señal de una comprensión general verdadera.

¿Está resuelta la pregunta sobre la generalización?

Este debate vuelve constantemente a la misma pregunta: ¿pueden los modelos de lenguaje desarrollar capacidades que vayan más allá de reproducir y recombinar sus datos de entrenamiento, especialmente en áreas donde los resultados no pueden ser verificados automáticamente? Los científicos no logran ponerse de acuerdo sobre la respuesta.

El debate sobre la inteligencia artificial general sigue abierto entre investigadores de Deepmind y el mundo académico
El debate sobre la inteligencia artificial general sigue abierto entre investigadores de Deepmind y el mundo académico

La discusión sobre la generalización sigue siendo el punto central de fricción en la comunidad de IA, donde expertos como Tom Zahavy de Google Deepmind cuestionan los límites actuales de los LLMs.

Hunt sitúa su confianza en este avance en solo un 40 por ciento y reconoce que los avances técnicos podrían demostrar que está equivocado, por ejemplo, si modelos de IA especializados se combinan en algo que se asemeje más a una inteligencia general. En un artículo de posición reciente titulado "LLMs can't jump", Tom Zahavy de Google Deepmind ofrece una explicación estructural de por qué los modelos son desiguales. Los modelos de lenguaje son buenos en deducción e inducción, pero fallan en la abducción creativa, es decir, la capacidad de inventar una causa para la cual aún no existe precedente lingüístico. Como posible solución, Zahavy apunta a modelos de mundo controlables por acciones que permitan experimentos contrafácticos. Los LLMs aún podrían jugar un papel clave en tales sistemas avanzados, incluso si alcanzan sus límites al trabajar solos.

Vía The Decoder.