Proporcionar a los desarrolladores el mejor modelo para cada tarea específica siempre ha sido nuestro objetivo principal. A principios de este año, facilitamos este proceso lanzando la selección automática de modelos, la cual revisa su tarea y la vincula con el modelo más adecuado. Hoy, presentamos Project HydraFusion, una vista previa de investigación que ofrece inteligencia de frontera mediante orquestación en tiempo de ejecución. Esta crea un plan de ejecución completo, seleccionando modelos de diversos proveedores para redactar, criticar y revisar, o escalar hacia modelos más potentes para completar la tarea.

HydraFusion desempeña un papel clave en nuestra estrategia global para ofrecer enrutamiento semántico automatizado entre modelos locales, en la nube y compuestos. Para los desarrolladores, esta complejidad permanece detrás de escena: usted selecciona HydraFusion como cualquier otro modelo, y este elige un flujo de trabajo que equilibra el rendimiento, el costo y la latencia para cada tarea.

HydraFusion trata la selección del flujo de trabajo como un problema de optimización. Utiliza señales de capacidad para el razonamiento, la generación de código, la depuración y el uso de herramientas con el fin de seleccionar el patrón de ejecución más eficiente para alcanzar el estándar de calidad requerido. Para cada solicitud, HydraFusion selecciona actualmente uno de tres patrones de ejecución:

  • Single (Único): Un modelo seleccionado resuelve la tarea directamente.
  • Cascade (Cascada): Un modelo eficiente redacta una solución y un filtro de calidad decide si aceptarla o escalar a un modelo más robusto.
  • Critique (Crítica): Un modelo redacta un resultado, un crítico independiente de solo lectura de una familia de modelos diferente lo revisa (siguiendo el mismo patrón de revisión que el Rubber Duck), y el modelo redactor revisa el trabajo una vez.

Cada patrón aborda un equilibrio diferente entre calidad y costo. El patrón Single preserva la velocidad y eficiencia cuando un modelo puede resolver la tarea directamente. Cascade brinda a un modelo eficiente el primer intento, manteniendo al mismo tiempo una ruta hacia una inferencia más potente cuando el candidato no supera el filtro de aceptación. Critique añade una perspectiva independiente para tareas donde la revisión es más útil que otro intento sin asistencia.

En evaluaciones offline a través de tres benchmarks de codificación agentica, HydraFusion demostró consistentemente una calidad de nivel de frontera con ahorros de costos estimados sustanciales. En TerminalBench 2.1, mejoró la calidad de las tareas verificadas en 4.9 puntos porcentuales con un costo estimado 67% menor en comparación con Claude Opus 5.

¿Cómo funciona la orquestación adaptativa de modelos?

Los desarrolladores ya coordinan modelos manualmente: eligiendo uno para una tarea, pidiendo a otro que revise el trabajo o escalando un problema difícil a un modelo más capaz. HydraFusion lleva ese proceso familiar al tiempo de ejecución. Usted elige HydraFusion una vez y se mantiene enfocado en su tarea mientras el sistema gestiona los modelos y el flujo de trabajo en segundo plano.

La clave es la selectividad. Algunas tareas de programación pueden resolverse directamente, mientras que otras se benefician de la revisión, revisión o escalamiento. HydraFusion evalúa cada solicitud y elige el flujo de trabajo menos complejo que se espera satisfaga sus necesidades, utilizando llamadas adicionales a modelos solo cuando es probable que mejoren el resultado. Este enfoque adaptativo equilibra la calidad, el costo y la latencia entre los distintos modelos.

A medida que avanza la frontera de los modelos, también lo hace HydraFusion. Cuando nuevos modelos están disponibles en GitHub Copilot, podemos evaluarlos e incorporarlos a su pool de modelos, aprovechando sus fortalezas para las tareas mejor adaptadas a ellos.

¿Qué principios sostienen a HydraFusion?

Convertir la orquestación adaptativa multi-modelo en una experiencia de programación confiable requiere un control cuidadoso de la ejecución, la revisión, el costo y el estado del repositorio. HydraFusion se construye sobre cinco principios operativos:

1. Contabilidad completa: Agrega el costo y el uso a través de cada etapa del flujo de trabajo, incluyendo redacción, crítica, revisión, escalamiento, reintento y respaldo. 2. Ejecución acotada: Asigna a cada etapa un comportamiento explícito de tiempo de espera y cancelación para mantener la ejecución y el costo dentro de límites definidos. 3. Revisión aislada: Ejecuta los pasos de revisión en contextos aislados y sin herramientas, mientras que los pasos de resolución utilizan el espacio de trabajo compartido y el bucle de agente estándar con conciencia de permisos. Esto permite a los modelos evaluar el trabajo de forma independiente sin modificar el repositorio. 4. Aplicación a prueba de fallos: No aplica ningún parche cuando el flujo de trabajo se cancela o falla la validación, evitando que cambios incompletos lleguen al repositorio. 5. Enrutamiento validado: Verifica las definiciones del flujo de trabajo, las vinculaciones de modelos, el comportamiento de respaldo y la disponibilidad del modelo antes de que comience la ejecución.

Juntos, estos principios hacen que la orquestación multi-modelo sea práctica para el trabajo a nivel de repositorio. Internamente, el tiempo de ejecución registra el rol, el resultado, el costo, la latencia y los diagnósticos de cada etapa para que el flujo de trabajo pueda entenderse después de la ejecución. Externamente, el desarrollador recibe una respuesta coherente y un conjunto de cambios consciente de los permisos.

Resultados de los benchmarks

Las políticas fijas de HydraFusion fueron evaluadas a través de tres benchmarks de codificación agentica: TerminalBench 2.1, DeepSWE y CheckpointBench, nuestro benchmark interno basado en sesiones reales de GitHub Copilot, utilizando Claude Opus 5 y GPT-5.6 Sol como líneas base de comparación. Cada política utilizó las mismas entradas de tarea, herramientas, límites de ejecución, supuestos de precios, condiciones de calificación y tratamiento de resultados faltantes.

La evaluación midió la calidad de la tarea verificada, que es la proporción de tareas confirmadas como respondidas correctamente, y el costo total estimado del flujo de trabajo. La contabilidad de costos incluyó cada etapa invocada, como redacción, crítica, revisión, escalamiento, reintento y respaldo. Los resultados muestran la mejor configuración ajustada de HydraFusion.

Estos resultados offline controlados son específicos de las revisiones de benchmark evaluadas, configuraciones de flujo de trabajo, pool de modelos y supuestos de precios, con todos los modelos evaluados al mismo nivel de razonamiento medio. A través de esta vista previa de investigación, validaremos cómo estos resultados se traducen a cargas de trabajo reales de desarrolladores y utilizaremos los hallazgos para optimizar aún más HydraFusion en términos de calidad de producción, latencia, confiabilidad, eficiencia de caché, costo y seguridad.

TerminalBench 2.1 TerminalBench 2.1 evalúa a los agentes de codificación en tareas complejas de múltiples pasos en entornos de terminal. La Figura 2 compara HydraFusion y Opus 5 en calidad de tarea verificada y costo estimado del flujo de trabajo.

DeepSWE DeepSWE evalúa tareas desafiantes de ingeniería de software a nivel de repositorio que requieren navegar por grandes bases de código, comprender dependencias entre archivos y producir correcciones completas. En este benchmark, HydraFusion queda a 1.5 puntos porcentuales de Opus 5 mientras reduce el costo en un 36%, lo que demuestra un equilibrio convincente entre calidad y costo para tareas de ingeniería complejas del mundo real.

CheckpointBench CheckpointBench es un benchmark interno de múltiples turnos curado a partir de sesiones reales de codificación agentica con GitHub Copilot. Cada conversación está anclada a un repositorio público específico y un commit inmutable, asegurando que cada sesión sea repetible. El benchmark está equilibrado según el lenguaje, el tipo de tarea y la dificultad, resultando en un conjunto de evaluación realista que refleja fielmente las sesiones agenticas de producción. En este benchmark, HydraFusion alcanza una diferencia de 0.1 puntos porcentuales frente a Opus 5 con un costo 65% menor.

Las pruebas internas iniciales han respaldado este resultado. Como señaló un ingeniero de software principal en Microsoft: "Hasta ahora, la capacidad de razonamiento y resolución de tareas [de HydraFusion] está al nivel o mejor que Opus".

Optimización continua de HydraFusion

Las políticas de enrutamiento de HydraFusion fueron moldeadas por cómo los desarrolladores usan GitHub Copilot en tareas de codificación reales. Para hacer que esos flujos de trabajo sean reproducibles, curamos CheckpointBench a partir de trayectorias reales de sesiones de codificación con Copilot. Refinamos HydraFusion repetidamente a través de CheckpointBench, DeepSWE y TerminalBench 2.1, optimizando sobre los conjuntos de evaluación en lugar de enfocarnos en un solo benchmark. Los puntajes por capacidad de HydraFusion proporcionaron una base consistente para comparar políticas de enrutamiento candidatas.

Vía GitHub Blog.