Cursor puso a competir a su enjambre de agentes renovado contra la version anterior con una prueba exigente: reconstruir SQLite en Rust usando unicamente la documentacion, sin acceso al codigo fuente ni a internet. Cada configuracion del sistema nuevo alcanzo el 100 por ciento en la bateria de pruebas, mientras que el enjambre viejo se estanco en sus propios conflictos de fusion.
En Cursor, las flotas de agentes pasaron de proyecto de investigacion a producto central. Con Cursor 3, los desarrolladores pueden correr flotas enteras de agentes de IA en paralelo. Anysphere, la empresa detras de Cursor, fue adquirida recientemente por SpaceX, de Elon Musk, por USD 60.000 millones.
¿Como se reparten el trabajo los agentes?
El sistema divide a los agentes en dos roles. Los agentes planificadores, que usan modelos de frontera potentes, descomponen recursivamente una meta en tareas mas pequenas. Los agentes trabajadores, que usan modelos mas rapidos y economicos, ejecutan esas tareas. El resultado es un arbol de tareas que se adapta a medida que avanza el trabajo.
Segun Cursor, esta division de roles resuelve sobre todo un problema de contexto. Un agente solitario debe recorrer el arbol completo sin perder de vista ni la meta ni la tarea actual, lo que explica por que los agentes se desvian en trabajos largos. En el enjambre de Cursor, los planificadores no escriben codigo y los trabajadores no planifican.
¿Por que Cursor construyo su propio control de versiones?
Un enjambre anterior basado en navegador alcanzaba cerca de 1.000 commits por hora sobre Git, apoyado en trabajadores, un agente juez y un integrador que resolvia conflictos. Ese integrador termino generando mas cuellos de botella de los que eliminaba.
El nuevo enjambre llego a 1.000 commits por segundo, un ritmo que obligo a Cursor a construir su propio sistema de control de versiones, porque los agentes a esa velocidad crean fallas que los equipos humanos nunca enfrentan. En lo que la empresa llamo "diseno de cerebro dividido", dos planificadores construian la misma idea en lugares distintos y de formas distintas.
Para contenerlo, Cursor hizo que los agentes registraran sus decisiones en documentos de diseno compartidos, con codigo enlazado a cada decision mediante una referencia verificada en tiempo de compilacion. Cuando aparecia un conflicto de fusion, un agente neutral intervenia y lo resolvia; los trabajadores marcaban archivos inflados para que un agente externo los dividiera en modulos.
La prueba: 835 paginas de manual y cero atajos
Cursor entrego al enjambre el manual de SQLite de 835 paginas y le ordeno construir una implementacion en Rust. Retuvo el codigo fuente, las suites de pruebas, el binario de SQLite y el acceso a internet. El banco de pruebas era sqllogictest, un conjunto con millones de consultas SQL de respuestas conocidas que el enjambre ni siquiera sabia que existia.
Se probaron cuatro configuraciones: GPT-5.5 en solitario, Grok 4.5 en solitario, Opus 4.8 como planificador con Composer 2.5 como trabajador, y Fable 5 como planificador con Composer 2.5 como trabajador. El sistema nuevo supero al viejo en todas. Tras cuatro horas, las corridas nuevas puntuaban entre 73 y 85 por ciento y las viejas entre 11 y 77 por ciento; cada configuracion del sistema nuevo llego despues al 100 por ciento.
¿Cuanto trabajo desperdicio el enjambre viejo?
Las corridas con Grok 4.5 dejaron en evidencia al sistema antiguo. El enjambre viejo produjo 68.000 commits en dos horas, unas 70 veces mas que el nuevo, y la mayoria fue trabajo desperdiciado: acumulo mas de 70.000 conflictos de fusion, mientras que la corrida nueva se mantuvo bajo 1.000 durante toda la prueba.
El archivo mas disputado en la corrida vieja registro 7.771 conflictos de 1.173 agentes, frente a 47 en la nueva. El mismo problema de cerebro dividido aparecio en la estructura del paquete: la version vieja partio el proyecto en 54 crates de Rust con tres paquetes SQL separados, mientras que la nueva se asento pronto en nueve.
| Metrica | Enjambre viejo | Enjambre nuevo |
|---|---|---|
| Commits (2 h, Grok 4.5) | 68.000 | ~1.000 |
| Conflictos de fusion | mas de 70.000 | menos de 1.000 |
| Conflictos en el peor archivo | 7.771 | 47 |
| Paquetes (crates de Rust) | 54 | 9 |
| Lineas de motor (config. Fable 5) | 64.305 | 9.908 |
| Lineas de motor (config. Opus) | 19.013 (97%) | 4.645 (100%) |
Con puntajes iguales o mejores, la nueva arquitectura recorto el tamano del codigo hasta en un 85 por ciento.
¿Donde estuvo el ahorro real de costos?
Los costos totales fueron desde USD 1.339 para el hibrido con Opus hasta USD 10.565 para GPT-5.5 corriendo solo. Los trabajadores consumieron al menos el 69 por ciento de los tokens en cada corrida y por lo general mas del 90 por ciento. Como los tokens de planificacion cuestan mas, la division del gasto se veia distinta: en el hibrido con Opus, el planificador genero una fraccion pequena de los tokens pero represento dos tercios de la cuenta.
El modelo trabajador fue el que abrio la mayor brecha de costo. En la corrida de GPT-5.5, solo los trabajadores costaron USD 9.373; en la de Opus con Composer, toda la flota de trabajadores costo USD 411 con calidad comparable. La diferencia esta casi por completo en el precio: Composer 2.5 rinde al nivel de Opus 4.7 y GPT-5.5, pero cuesta apenas USD 0,50 por millon de tokens de entrada y USD 2,50 por millon de salida. El modelo se basa en Kimi K2.5, segun el fundador de Cursor, Michael Truell.
Cursor sostiene que solo unas pocas partes de una tarea grande necesitan la inteligencia de un modelo de frontera, entre ellas el desglose de tareas y las decisiones clave de diseno. Una vez que el planificador de frontera resuelve la ambiguedad, los modelos economicos pueden seguir su plan, aunque las corridas hibridas mostraron que la calidad del planificador todavia importa: el planificador Fable 5 uso menos tokens de planificacion que Opus, pero sus trabajadores necesitaron muchos mas para terminar, y la corrida de Fable salio mas cara.
¿Ya sirve fuera del laboratorio?
Cursor describe a los enjambres como una especie de compilador probabilistico que traduce intencion en trabajo ejecutable, paso a paso, y afirma que describir esa intencion con precision fue la principal restriccion del experimento. La empresa publico en GitHub el codigo de la corrida de Opus en solitario, bajo el nombre minisqlite.
Ejercicios como este ya no se limitan al laboratorio. Una version preliminar de Fable 5 se encargo de la mayor parte de la reescritura de Bun de Zig a Rust: 64 instancias escribieron mas de un millon de lineas de codigo en 11 dias por cerca de USD 165.000. El uso en produccion, sin embargo, todavia luce distinto. Un estudio publicado a fines de 2025 encontro que el 68 por ciento de los agentes usados en produccion completaron no mas de diez pasos antes de que un humano interviniera; para el 47 por ciento, el limite fue menos de cinco.




