Generación de trayectorias, trazas de razonamiento y auto-etiquetado con NVIDIA Alpamayo 2 Super

GIF que muestra un vehículo autónomo navegando en entorno urbano.
GIF que muestra un vehículo autónomo navegando en entorno urbano.
  • NVIDIA Alpamayo 2 Super es un modelo de razonamiento visión-lenguaje-acción (VLA) abierto de 34 mil millones de parámetros, que combina el razonador Cosmos 3 Super de 32B y un experto en acciones de 2B, post-entrenado con aprendizaje por refuerzo para ofrecer generación unificada de trayectorias, razonamiento, predicción de meta-acciones, VQA con grounding 2D y auto-etiquetado para flujos de trabajo de vehículos autónomos (AV).
  • El modelo soporta percepción de 360 grados desde hasta siete cámaras y genera trayectorias futuras, trazas de razonamiento de cadena de causalidad (Chain-of-Causation), meta-acciones de alto nivel, respuestas fundamentadas sobre la escena y auto-etiquetas de razonamiento estructurado, facilitando el uso de modelos base comunes en la enseñanza de políticas offline, evaluación, curación de datos y personalización de tareas.
  • Alpamayo 2 Super logra resultados de vanguardia en predicción de trayectorias (minADE_6 de 0.911 m), razonamiento AV (0.433), LingoQA (79.2), IoU de meta-acciones (lateral: 74.59, longitudinal: 61.91, por carril: 73.55), similitud de respuestas VQA (0.652), IoU de grounding 2D (0.71) y AlpaSim Score de ciclo cerrado (1.50 ± 0.13), superando a modelos anteriores y permitiendo un desarrollo y evaluación de AV eficiente y escalable.

El desarrollo de vehículos autónomos (AV) a menudo depende de modelos separados para la generación de trayectorias, predicción de intenciones de alto nivel, comprensión de escenas y etiquetado de datos. Esta separación dificulta la comparación de resultados relacionados, la investigación del comportamiento del modelo y la reutilización de las mismas representaciones a lo largo del flujo de trabajo de desarrollo.

NVIDIA Alpamayo 2 Super es un modelo de razonamiento visión-lenguaje-acción (VLA) abierto de 34 mil millones de parámetros diseñado para acelerar el desarrollo de AV. Combina el razonador NVIDIA Cosmos 3 Super de 32 mil millones de parámetros con un experto en acciones basado en difusión de 2 mil millones de parámetros, y está post-entrenado con aprendizaje por refuerzo. El razonador interpreta video de múltiples cámaras, contexto de lenguaje e historial de movimiento previo, mientras que el experto en acciones convierte la representación interna resultante del modelo en una trayectoria futura para el vehículo.

La percepción de Alpamayo 2 Super se expande a una cobertura de 360 grados a través de hasta siete cámaras y puede devolver múltiples salidas complementarias: trayectorias futuras, trazas de razonamiento de Cadena de Causalidad (CoC), meta-acciones de alto nivel, respuestas fundamentadas a preguntas sobre la escena y auto-etiquetas de razonamiento.

Este diseño multitarea brinda a los desarrolladores de AV una base común en múltiples etapas del flujo de trabajo de desarrollo. El mismo modelo base puede utilizarse como profesor de políticas offline, crítico de evaluación, motor de datos o punto de partida para la personalización de nuevas tareas, en lugar de mantener un modelo separado para cada etapa del proceso.

Esta publicación ofrece una introducción práctica a cuatro flujos de trabajo habilitados por Alpamayo 2 Super:

  • Generar trayectorias y trazas de razonamiento CoC, evaluando los resultados en benchmarks de ciclo abierto y ciclo cerrado.
  • Predecir meta-acciones como ceder el paso, cambiar de carril y detenerse junto a una trayectoria.
  • Realizar preguntas en lenguaje natural sobre una escena de conducción con múltiples cámaras.
  • Generar auto-etiquetas CoC con grounding 2D en sus propios clips de video.

Los pesos del modelo están disponibles en Hugging Face y los notebooks de inferencia en GitHub. El modelo se lanza bajo OpenMDW-1.1, la licencia permisiva de Linux Foundation para distribuciones de modelos abiertos, que cubre el ajuste fino, modelos derivados y redistribución comercial. Los modelos destilados pueden desplegarse comercialmente sin permiso adicional de NVIDIA, y las salidas del modelo no conllevan condiciones de licencia.

Figura 1. Alpamayo 2 Super procesa entradas multimodales a través de un razonador Cosmos 3 Super de 32B y un experto en acciones de 2B.
Figura 1. Alpamayo 2 Super procesa entradas multimodales a través de un razonador Cosmos 3 Super de 32B y un experto en acciones de 2B.

Planificación y razonamiento

Razonar a través de nuevos escenarios es un problema fundamental en la conducción autónoma. Navegar por zonas de construcción, peatones parcialmente ocultos, interacciones inusuales de derecho de paso y objetos que ingresan a la carretera requiere más que igualar un patrón de trayectoria común. Un modelo de conducción útil debe identificar el contexto de la escena que importa, conectarlo con la decisión de conducción apropiada y producir una acción consistente con esa decisión.

¿Qué son las trayectorias y trazas CoC y por qué son importantes?

Alpamayo 2 Super, al igual que sus predecesores, produce conjuntamente trayectorias de salida y trazas de razonamiento CoC. La trayectoria expresa qué podría hacer el vehículo a continuación. La traza de razonamiento CoC proporciona información sobre por qué se tomó una decisión de conducción a partir del contexto observado de la escena. Devolver ambas salidas facilita la comprensión de la toma de decisiones del modelo, la curación de casos difíciles, la comparación de una política desplegada con un profesor más grande y el diagnóstico de si un fallo se originó en la percepción, el razonamiento o la generación de acciones. Las trazas CoC también se integran en los flujos de trabajo de validación de seguridad de NVIDIA Halos, permitiendo la introspección sobre la comprensión de la escena por parte del modelo.

El notebook de inferencia del repositorio de Alpamayo 2 Super carga un clip de vista envolvente, prepara el historial de movimiento del vehículo y muestrea una trayectoria con su traza CoC asociada. El paso central de inferencia y las salidas se muestran a continuación.

Python
from alpamayo2_super import helper
from alpamayo2_super.load_physical_aiavdataset import load_physical_aiavdataset
from alpamayo2_super.models.alpamayo2_super import Alpamayo2Super
from alpamayo2_super.visualization import plot_inference_result

data = load_physical_aiavdataset(
  "030c760c-ae38-49aa-9ad8-f5650a545d26",
   t0_us=2000000,
)

model = Alpamayo2Super.from_pretrained("nvidia/Alpamayo2-Super", dtype=torch.bfloat16, device_map="cuda:0")
model_inputs = helper.prepare_model_inputs(data, model.config, model.tokenizer)
model_inputs = helper.to_device(model_inputs, "cuda")

torch.cuda.manual_seed_all(42)
with torch.autocast("cuda", dtype=torch.bfloat16):
   pred_xyz, pred_rot, logprob, extra = model.sample_trajectories_from_data(
       data=model_inputs,
       top_p=0.98,
       temperature=0.6,
       num_traj_samples=1,
       diffusion_kwargs={"inference_step": 10},
       return_extra=True,
   )

fig, metadata = plot_inference_result(
   data=data,
   pred_xyz=pred_xyz,
   extra=extra,
)
Figura 2. Alpamayo 2 Super realizando planificación en una escena desafiante de tráfico.
Figura 2. Alpamayo 2 Super realizando planificación en una escena desafiante de tráfico.

Métodos de evaluación

Para evaluar el razonamiento de salida y la calidad de la trayectoria del modelo, podemos utilizar métodos de evaluación de ciclo abierto y ciclo cerrado. La evaluación de ciclo abierto mide la calidad de la trayectoria y el razonamiento en escenas grabadas comparándolas con etiquetas de verdad fundamental (ground-truth).

Alpamayo 2 Super logra los siguientes resultados:

  • Predicción de trayectoria: A través de 1,434 muestras desafiantes del Physical AI AV Dataset, registra un minADE_6 de 6.4 segundos de 0.911 m.
  • LingoQA: Alpamayo 2 Super alcanza 79.2 en el benchmark LingoQA, ocupando el primer lugar entre 37 modelos evaluados. Con 34 mil millones de parámetros, supera a Qwen2.5-VL (72B) por 17.0 puntos, Qwen3-VL (32B) por 7.0 puntos, Gemini 2.5 Pro por 15.1 puntos y GPT-4o por 23.2 puntos.

Valores más bajos de minADE_6 indican mejores predicciones de trayectoria; puntuaciones de razonamiento más altas indican un mejor desempeño. El principal desafío con las métricas de ciclo abierto es su naturaleza estática.

Vía NVIDIA Developer.