NVIDIA Cosmos-H-Dreams: Simulación quirúrgica en tiempo real
La robótica quirúrgica está evolucionando rápidamente, pasando de la teleoperación hacia políticas de visión-lenguaje-acción cada vez más capaces. Sin embargo, evaluar y entrenar estos sistemas sigue siendo un desafío complejo. Las plataformas robóticas físicas son costosas de operar, los experimentos son lentos de reproducir y los errores pueden dañar instrumentos o materiales biológicos sensibles. Los simuladores convencionales ofrecen una alternativa más segura, pero las escenas quirúrgicas son excepcionalmente difíciles de modelar: el tejido deformable, las interacciones precisas de los instrumentos, las superficies especulares, las suturas, las agujas, el humo y las oclusiones son factores críticos que deben considerarse.
Los modelos de mundo (world foundation models) ofrecen un camino diferente. En lugar de diseñar manualmente cada objeto e interacción física, estos aprenden dinámicas visuales directamente a partir de video sincronizado y cinemática robótica. El Cosmos-H-Surgical-Simulator de NVIDIA demostró este enfoque al generar videos quirúrgicos futuros a partir de una escena inicial y una secuencia de acciones robóticas. Esto permitió una evaluación más rápida que en el mundo físico y la generación de datos sintéticos en todo el ecosistema Open-H-Embodiment.
Hoy presentamos el siguiente paso: Cosmos-H-Dreams, un simulador generativo para robótica quirúrgica condicionado por acciones y en tiempo real. Cosmos-H-Dreams destila las capacidades del Cosmos-H-Surgical-Simulator en un modelo causal de pocos pasos y lo ofrece a través de FlashDreams, la librería de inferencia de streaming acelerada de NVIDIA. Al ejecutarse en una sola GPU NVIDIA RTX PRO 6000, el resultado es un entorno interactivo que una persona o una política aprendida puede controlar en un bucle cerrado.
1. Del modelo de mundo quirúrgico al simulador interactivo
El Cosmos-H-Surgical-Simulator es un modelo de base mundial condicionado por acciones, construido sobre Cosmos-Predict2.5-2B de NVIDIA y post-entrenado con el conjunto de datos Open-H-Embodiment. Dado un marco de contexto quirúrgico y una trayectoria futura del robot, genera un video que muestra las probables consecuencias visuales de esas acciones. Esto lo hace útil para la evaluación de políticas fuera de línea y la generación de datos sintéticos. Una trayectoria grabada o generada por una política puede enviarse al modelo, el despliegue correspondiente puede generarse y el resultado puede inspeccionarse o calificarse sin ejecutar repetidamente el movimiento en un robot físico.
Cosmos-H-Dreams traslada el modelo al régimen de tiempo real. Partiendo de los antecedentes quirúrgicos multi-embodiment aprendidos por Cosmos-H-Surgical-Simulator, especializamos el modelo para la sutura de mesa con el da Vinci Research Kit (dVRK) y lo destilamos en un estudiante causal que genera la escena de forma autorregresiva. El modelo liberado recibe un marco RGB inicial y un flujo en vivo de cinemática robótica, para luego producir el siguiente bloque de cuadros antes de continuar con el siguiente bloque de acción.
También hemos demostrado la versatilidad de Cosmos-H-Dreams colaborando con CMR Surgical y Cambridge Consultants para integrarlo con el controlador de cirujano Versius, permitiendo la operación en tiempo real en la plataforma Versius.
2. Destilando Cosmos-H-Surgical-Simulator para tiempo real
El desafío clave es preservar las dinámicas quirúrgicas útiles mientras se reduce el costo de generación. Cosmos-H-Dreams utiliza un pipeline de entrenamiento profesor-estudiante diseñado para despliegues autorregresivos largos.
2.1. Un profesor quirúrgico
El profesor bidireccional comienza desde el punto de control Open-H del Cosmos-H-Surgical-Simulator, que utiliza una representación de acción unificada de 44 dimensiones. Para el modelo de mesa dVRK liberado, el contenido de acción dVRK de doble brazo, que consiste en la traslación relativa del efector final, la rotación y el estado de la pinza, se mapea en esta representación común.
El profesor se ajusta (fine-tuning) en la mezcla de mesa JHU dVRK, incluyendo demostraciones exitosas, así como fallas y episodios fuera de distribución como caídas de agujas, lanzamientos fallidos y nudos no logrados. Estos fallos son importantes: un simulador destinado a evaluar políticas debe reproducir las consecuencias de malas acciones, no solo demostraciones ideales.
Para mejorar la estabilidad durante despliegues largos, el proceso de entrenamiento aumenta progresivamente el horizonte temporal del profesor. Comenzamos el entrenamiento en un horizonte de 12 cuadros y aumentamos este número progresivamente hasta alcanzar 72 cuadros. En cada incremento del horizonte, inicializamos el modelo preentrenado con los pesos previos.
2.2. Calentamiento causal
Las trayectorias de eliminación de ruido (denoising) del profesor se precalculan y almacenan en caché. Un estudiante causal se inicializa desde el profesor y se entrena para imitar estas trayectorias almacenadas. Esta etapa de calentamiento enseña al estudiante a operar con atención causal y una caché de clave/valor (KV) de streaming antes de que comience a aprender de su propia historia generada.
2.3. Destilación por auto-forzado
Los modelos autorregresivos enfrentan un problema conocido: durante el entrenamiento pueden ver un contexto real (ground-truth), mientras que durante el despliegue deben condicionarse a sus propias salidas imperfectas. Por lo tanto, los errores pequeños pueden acumularse con el tiempo.
Cosmos-H-Dreams aborda este desajuste con la destilación por auto-forzado. Durante el entrenamiento, el estudiante avanza utilizando su propio contexto generado. La supervisión de coincidencia de distribución del profesor congelado guía esos despliegues auto-generados hacia videos quirúrgicos realistas. Esto prepara al estudiante para las mismas condiciones que encontrará durante la inferencia interactiva.
El modelo resultante admite difusión de pocos pasos, con tan solo dos pasos de eliminación de ruido por marco latente, en lugar del proceso de múltiples pasos utilizado por el profesor completo. Combina los antecedentes quirúrgicos del profesor con la estructura causal necesaria para el streaming.
3. FlashDreams: El motor de inferencia en tiempo real
La destilación del modelo es solo una parte de la historia en tiempo real. Cosmos-H-Dreams se sirve a través de FlashDreams, una librería de inferencia acelerada para modelos mundiales y de video autorregresivos.
FlashDreams convierte al estudiante destilado en un sistema de streaming de baja latencia a través de varias optimizaciones complementarias, como caché KV de streaming, captura de gráficos CUDA o compilación de modelos.
En conjunto, estas técnicas llevan el ajuste del modelo de mundo quirúrgico destilado desde el régimen de aproximadamente diez cuadros por segundo de la inferencia estándar del Cosmos-H-Surgical-Simulator a una operación interactiva (~160 cuadros por segundo) en una sola NVIDIA RTX PRO 6000.
Cosmos-H-Dreams también proporciona las interfaces hombre-máquina que convierten la generación en interacción. Un cliente de navegador puede enviar comandos de teclado y recibir cuadros generados a través de WebRTC. Un cliente de Meta Quest puede mapear el movimiento del controlador rastreado en acciones robóticas y mostrar la escena sintetizada a través de WebXR. El mismo modelo también puede conectarse a una política quirúrgica aprendida, con observaciones generadas y acciones predichas intercambiadas dentro de un bucle cerrado.
4. ¿Cómo adaptar el sistema a sus propios datos?
Aunque Cosmos-H-Dreams incluye un punto de control preentrenado para sutura de mesa, el sistema está diseñado para ser extensible a su propio embodiment. Para entrenar un modelo estudiantil en tiempo real para su propio conjunto de datos, proporcionamos una receta completa para el ajuste fino del profesor y la destilación de auto-forzado en nuestra guía paso a paso.
5. ¿Qué sigue: Hacia la IA física quirúrgica de bucle cerrado?
Cosmos-H-Dreams abre una nueva frontera para la simulación quirúrgica: entornos aprendidos a partir de datos robóticos reales que son lo suficientemente receptivos como para ser habitados.
El siguiente paso inmediato es evaluar más que la calidad visual. Un simulador quirúrgico útil debe responder correctamente a las acciones, prediciendo no solo la apariencia, sino la física y la respuesta del tejido, consolidando el futuro de la robótica asistida por IA.
Vía Hugging Face.




