Los agentes de investigación en inteligencia artificial ya son capaces de proponer, implementar y calificar sus propios experimentos de machine learning. La generación de ideas es económica, pero su verificación no lo es. Entrenar a un solo candidato puede consumir desde horas hasta días de tiempo de GPU, por lo que un agente suele proponer muchos más candidatos de los que puede permitirse ejecutar. La verdadera palanca para el progreso en la investigación reside en decidir cuáles de ellos se llevan a cabo.
Un equipo de investigación de FAIR en Meta, la Universidad de Oxford y el University College London ha formalizado esta palanca como preferencia de investigación e introduce los AI Research Preference Models (RPMs). Un RPM clasifica a los candidatos no ejecutados y selecciona uno para su ejecución. El modelo nunca intenta pronosticar una puntuación absoluta, ya que el equipo descubrió que los modelos de lenguaje no son fiables al predecir métricas o resultados de ejecución.
¿Es desplegable esta tecnología? Parcialmente. Los RPMs utilizan LLMs preentrenados congelados sin necesidad de fine-tuning. El framework AIRA-dojo y el benchmark AIRS-Bench son de código abierto, y el modelo base Qwen3.6-27B tiene pesos abiertos.
¿Dónde se sitúa el RPM en el bucle del agente?
AIRA-dojo es una búsqueda en árbol evolutiva: selección voraz de padres, operadores de borrador/mejora/depuración y el retorno del nodo con la puntuación de validación más alta al finalizar. El RPM interviene únicamente en la creación de hijos. En lugar de generar un hijo y ejecutarlo, el agente aplica el operador 15 veces en paralelo para obtener 15 candidatos no ejecutados, comparándolos luego por pares en un torneo de eliminación. Solo el ganador se ejecuta. Cada comparación se fundamenta en nodos de contexto recolectados mediante un recorrido BFS del árbol explorado, mostrando cada uno la puntuación de validación obtenida.
Dos variantes y dos presupuestos de cómputo
RPM de solo inferencia: Un LLM que actúa como juez sobre planes candidatos, código e historial de búsqueda. Su prompt fue optimizado con MIPROv2 de DSPy, convergiendo en una rúbrica de investigador principal que tolera errores corregibles, premia la extensibilidad y penaliza direcciones redundantes, con una precisión offline del 57.7% al 59.0%.
RPM agentico: Utiliza el mismo juez y un sandbox que clona el entorno del agente, incluyendo una sola GPU H200. Las herramientas disponibles son python, bash y submit_solution. Realiza experimentos piloto a pequeña escala y, posteriormente, un modelo de retroalimentación propone el siguiente experimento más informativo o finaliza el bucle. Dos decisiones de diseño tienen peso: el presupuesto restante se sobreestima deliberadamente (se reportan 2,700 segundos frente a 300 reales) para que el agente no se detenga prematuramente, y los pilotos se limitan a 30 con un umbral de 60 segundos. El tiempo del piloto compite con el reloj del agente, por lo que el selector agentico solo se ejecuta en los pasos de borrador y mejora; la depuración vuelve a ser aleatoria.
Resultados en AIRS-Bench
Configuración: 20 tareas públicas de texto y tablas, 24 horas por tarea en una sola H200, 10 semillas, utilizando Qwen3.6-27B como backbone tanto para los operadores como para el RPM, asegurando que la mejora provenga de la capa de selección y no de un juez más potente.
La probabilidad de mejora sobre el sistema sin RPM es de 0.5923 y 0.5913, con límites inferiores de intervalo de confianza del 95% en 0.5066 y 0.5018.
La eficiencia es el resultado más práctico. La variante de solo inferencia alcanza la puntuación final de la línea base de 0.684 en 14.88 horas (1.61×), mientras que la variante agentica lo logra en 15.50 horas (1.55×). La inferencia autohospedada añade 0.660 horas por ejecución; incluso ajustando esto, se obtiene un 0.708 en 23.34 horas.
Se reportan dos nuevos resultados SOTA: WinoGrande 94.1% con el RPM agentico frente al SOTA anterior de 90.4% de AIRA₂, y SVAMP 95.7% con la variante de solo inferencia frente al SOTA humano anterior de 94.2%.
Conclusiones clave
- Los RPMs clasifican candidatos no ejecutados para que el agente de IA solo ejecute el más prometedor.
- Existen dos variantes de LLM congelado: un juez de solo inferencia y uno agentico que ejecuta pilotos breves.
- En AIRS-Bench, la puntuación normalizada promedio aumenta de 0.684 a 0.711 y 0.729 respectivamente.
- Ambos alcanzan la puntuación de 24 horas de la línea base en aproximadamente 15 horas, logrando una aceleración de 1.5–1.6×.
- Nuevo SOTA reportado en WinoGrande (94.1%) y SVAMP (95.7%).
Consulte el artículo original y el anuncio en LinkedIn. Siga a MarkTechPost en Twitter, únase a nuestro SubReddit de 150k+ ML, suscríbase a nuestro boletín o síganos en Telegram. ¿Necesita promocionar su repositorio de GitHub, producto o webinar? Conecte con nosotros.
Vía MarkTechPost.




