Un equipo de investigadores de UC Berkeley ha lanzado CUA-Lite, una plataforma abierta diseñada específicamente para agentes de computadora (CUA, por sus siglas en inglés). El argumento central detrás de este desarrollo es de carácter infraestructural más que centrado en modelos: el entrenamiento y la evaluación de un CUA requiere cuatro componentes fundamentales: agentes, entornos, trazas de datos y un framework para evaluarlos. Actualmente, estos cuatro elementos se encuentran fragmentados en repositorios distintos con interfaces incompatibles. CUA-Lite los integra bajo un mismo espacio de acción, un esquema de datos unificado y un comando único, funcionando tanto en escritorio como en navegador y dispositivos móviles.
¿Es desplegable? Sí. El stack se instala mediante uv sync --all-extras en Python 3.12, y sus sandboxes ligeros se ejecutan en cualquier host Docker sin necesidad de /dev/kvm. Esto permite que instancias en la nube, runners de CI y contenedores anidados funcionen sin problemas.
La carga impositiva de las VM y cómo Lite.OSWorld la elimina
La contribución más concreta de este lanzamiento es Lite.OSWorld. Mientras que OSWorld proporciona un entorno Ubuntu fiel, este se entrega como una máquina virtual QEMU/KVM completa por tarea, lo que requiere una virtualización anidada que la mayoría de la infraestructura gestionada no permite. CUA-Lite reproduce el mismo conjunto de tareas y evaluadores sobre un escritorio GNOME dentro de un contenedor Docker estándar.
La fidelidad es la preocupación lógica al reemplazar una VM por un contenedor, y el equipo aborda esto directamente: tras probar 13 modelos, los resultados de Lite.OSWorld coinciden con los de la VM de OSWorld, asegurando que el puntaje o la señal de entrenamiento obtenida en el contenedor sea transferible al benchmark original. La misma base ahora soporta una familia de sandboxes: Lite.ScaleCUA, Lite.CUAGym y Lite.CUAWorld, este último expandiéndose a aproximadamente 40 aplicaciones, incluyendo Blender, QGIS y VS Code. En total, la plataforma asegura contar con más de 30,000 tareas verificables.
Un esquema para datos, un adaptador por modelo
La segunda capa de CUA-Lite es LiteSample, un esquema de aprendizaje supervisado compartido entre todos los entornos, agentes y tipos de tareas, distribuido como archivos parquet junto con imágenes. Más de diez datasets de CUA existentes han sido preprocesados bajo este formato y publicados gratuitamente en Hugging Face, incluyendo Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey y Multimodal-Mind2Web. Junto a estos corpus, se encuentran nuevos datasets de despliegue generados mediante la ejecución de un modelo profesor de frontera a través de los sandboxes para destilar el conocimiento en modelos estudiantes más pequeños.
Dado que cada familia de modelos espera estructuras diferentes, el framework incluye un adaptador por modelo que empaqueta un LiteSample unificado en el formato de entrenamiento específico de cada arquitectura, incluyendo la colapsación de historial para que varios pasos compartan una misma pasada de inferencia.
Evaluación, SFT y RL bajo un solo comando
Los agentes y entornos se encuentran en lite.gym: capturas de pantalla hacia arriba y acciones hacia abajo, manteniendo un espacio de acción único por plataforma. Se han integrado más de 10 agentes (incluyendo GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI) y más de 15 benchmarks que abarcan tareas de grounding (ScreenSpot-Pro, OSWorld-G), escritorio (OSWorld, OSWorld-2, WindowsAgentArena, CUABench), navegador (WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym) y móvil (AndroidWorld, AndroidLab, MobileWorld, MobileGym). Cambiar --model-id y --env-id en scripts/rollout.py constituye la interfaz completa.
El mismo ciclo sirve para el entrenamiento. Para SFT (Fine-Tuning Supervisado), el README documenta el ajuste fino de Qwen3-VL-2B-Instruct en trayectorias de escritorio de Lite.ScaleCUA, elevando el retorno medio por episodio de 0.138 a 0.237 en el split de evaluación de 332 tareas de lite.osworld, una configuración reportada sobre dos GPUs. Para RL, los resultados obtenidos en el entorno impulsan actualizaciones GRPO sobre Slime, con un ejemplo funcional de MobileGym que cubre 416 tareas móviles en 28 aplicaciones.
Conclusiones clave
- CUA-Lite unifica agentes, entornos, trazas y entrenamiento bajo un mismo espacio de acción y el esquema
LiteSample.
- Lite.OSWorld ejecuta tareas de OSWorld sin máquinas virtuales en Docker con 0.9 GB frente a 4.1 GB, permitiendo aproximadamente 4.6 veces más escritorios en paralelo.
- Los puntajes en el contenedor coinciden con la VM de OSWorld en 13 modelos, asegurando la transferencia de señales de entrenamiento.
- Más de 30,000 tareas, 15+ benchmarks, 10+ agentes y 20+ datasets disponibles gratuitamente en Hugging Face.
- Desplegable en cualquier host Docker, aunque el repositorio aún no especifica una licencia, por lo que se recomienda verificar términos antes de su uso comercial.
Vía MarkTechPost.




