Para los robotaxis y el resto de los vehículos autónomos, el problema difícil no es el tráfico de todos los días. Son las situaciones raras y complejas, las que cuesta anticipar y para las que casi no hay datos de entrenamiento.

Resolver esos eventos de cola larga exige mucho más que detección de objetos y predicción de movimiento. El vehículo tiene que entender la escena, razonar sobre causa y efecto, elegir la acción correcta y convertir esa decisión en una trayectoria segura y cómoda, todo en tiempo real y de una forma que los desarrolladores puedan inspeccionar y validar.

NVIDIA Alpamayo 2 Super, ya disponible para uso comercial, es la nueva pieza de la familia Alpamayo, la colección de modelos abiertos de razonamiento para conducción autónoma con mayor adopción en Hugging Face. Está construido sobre NVIDIA Cosmos 3 Super Reasoner y se post-entrenó con aprendizaje por refuerzo.

¿Qué cambia la licencia OpenMDW?

Alpamayo 2 Super se distribuye bajo OpenMDW-1.1, la licencia permisiva de la Linux Foundation para distribuciones abiertas de modelos de IA. Cubre el ajuste fino, los modelos derivados y la redistribución comercial, de modo que fabricantes de autos, de camiones y proveedores pueden adaptarlo a sus propios datos y políticas de conducción.

El detalle no es menor. Las versiones anteriores de Alpamayo se habían publicado para investigación y desarrollo. Ahora la licencia OpenMDW se aplica a toda la familia de modelos, así que cualquiera de ellos puede desplegarse comercialmente sin pedir permisos adicionales. Eso convierte un camino de dos etapas, adaptación y luego negociación, en uno solo.

Los pesos abiertos son lo que vuelve viable esa ruta en términos económicos. Un equipo puede construir sobre razonamiento avanzado sin reentrenar desde cero cada capacidad base ni pagar costos de modelo frontera por cada tarea.

¿Qué tan bueno es frente a Gemini o GPT-4o?

Alpamayo 2 Super quedó primero en LingoQA, un benchmark de razonamiento para conducción autónoma, entre casi 40 modelos evaluados. En las pruebas de NVIDIA con la métrica Lingo-Judge, estas fueron las diferencias:

Modelo comparadoVentaja de Alpamayo 2 Super
GPT-4o23,2 puntos
Qwen2.5-VL 72B17,0 puntos
Gemini 2.5 Pro15,1 puntos

La comparación tiene una asimetría que conviene tener presente: los otros tres son modelos generalistas, mientras que Alpamayo está especializado en escenarios de conducción. Es una ventaja de dominio, no de capacidad general.

El modelo triplica la escala de Alpamayo 1.5 y Alpamayo 1, ambos de 10.000 millones de parámetros. Esa capacidad extra le permite generalizar el razonamiento a partir de ejemplos escasos, justo lo que se necesita en las interacciones raras entre varios actores en la vía. Además razona sobre la cobertura completa de cámaras del vehículo, fusionando las vistas frontal, laterales y trasera para dar contexto de 360 grados en cambios de pista, incorporaciones, virajes sin protección y cruces complejos.

Cinco salidas por cada situación

Para cada escena de manejo, el modelo produce cinco resultados acoplados entre sí:

  • Una trayectoria que describe la ruta planificada del vehículo.
  • Una traza de cadena de causalidad (CoC) que explica el razonamiento detrás de la decisión.
  • Una meta-acción que captura la intención del modelo (ceder el paso, cambiar de pista, detenerse).
  • Auto-etiquetas de razonamiento, que generan anotaciones CoC para datos de entrenamiento y validación.
  • Respuestas de preguntas visuales con anclaje 2D, que vinculan cada respuesta a regiones específicas de las imágenes de cámara.

Las trazas CoC se integran con los flujos de validación de seguridad de NVIDIA Halos y apuntan a los requisitos de la norma ISO/PAS 8800. Usado como auto-etiquetador sobre datos propios de flota, según NVIDIA el modelo comprime los ciclos de anotación de meses a días.

Del servidor al auto: cómo se usa en producción

La familia está pensada como un flujo en dos tramos. Alpamayo 2 Super entrega el razonamiento de mayor escala en la nube, donde se generan trazas de razonamiento, datos sintéticos de entrenamiento y salidas de profesor para destilación. Alpamayo 1.5 y Alpamayo 1 quedan como opciones más económicas para ese mismo trabajo en la nube. Los modelos destilados que resultan se optimizan después para inferencia en tiempo real dentro del vehículo.

El ecosistema alrededor incluye otras piezas abiertas:

  • NVIDIA AlpaSim, para simulación en lazo cerrado.
  • NVIDIA AlpaGym, para aprendizaje por refuerzo de alto rendimiento.
  • NVIDIA Physical AI Open Datasets, con datos para entrenamiento y pruebas.
  • Recetas de entrenamiento abiertas y una tubería de auto-etiquetado.

La familia Alpamayo ya superó las 500.000 descargas en Hugging Face, cifra que la posiciona como la colección de modelos abiertos de razonamiento para conducción autónoma más usada de la plataforma. Los modelos y herramientas están en el portal de descargas de NVIDIA DRIVE.

¿Sirve de algo en calles latinoamericanas?

Acá está el argumento más interesante para la región. Un modelo cerrado se entrena y valida contra el tipo de vía donde su dueño opera flota, que hoy significa avenidas anchas y señalización homogénea de ciudades estadounidenses. Con pesos abiertos y licencia comercial, un equipo en Santiago, Bogotá o São Paulo puede hacer ajuste fino sobre grabaciones propias: micros que se detienen fuera del paradero, motos filtrándose entre pistas, cruces sin demarcación visible.

Ese trabajo antes exigía negociar acceso a un modelo base o entrenar uno desde cero, dos barreras que en la práctica dejaban la conducción autónoma fuera del alcance de cualquier programa que no fuera de escala global. El auto-etiquetado con anclaje visual es la otra mitad de la ecuación: convierte horas de video de flota local en datos de entrenamiento sin un equipo de anotadores dedicado.