Personaliza NVIDIA Nemotron 3 Nano con Prime Intellect Lab en minutos

Configura un entorno de aprendizaje reforzado alojado en aproximadamente cinco minutos, evalúa la línea base y produce un adaptador LoRA descargable.

La personalización de modelos abiertos como la familia NVIDIA Nemotron 3 es ahora mucho más accesible utilizando plataformas como Prime Intellect Lab, que proporciona flujos de trabajo optimizados para tareas como el aprendizaje reforzado y el despliegue de adaptadores LoRA.

El proceso paso a paso implica establecer una línea base, entrenar con aprendizaje reforzado (demostrado mediante un entorno matemático de Python) y evaluar las mejoras, con resultados que muestran un aumento significativo en la precisión tras la personalización.

El mismo flujo de trabajo puede aplicarse a modelos más grandes en la línea NVIDIA Nemotron 3, y la disponibilidad de pesos abiertos, datos y recetas de entrenamiento permite la reproducibilidad, transparencia y una adaptación más sencilla para casos de uso específicos.

El contenido generado por IA puede resumir información de manera incompleta. Verifique la información importante. Más información

La personalización es lo que permite a los desarrolladores tomar un modelo general y adaptarlo a casos de uso, dominios, idiomas y más. Sin embargo, la personalización conlleva algunos desafíos. Requiere infraestructura, experiencia técnica y software específico para el flujo de trabajo, así como recursos como GPUs y la capacidad de utilizarlos eficazmente. También depende de conocimiento de dominio especializado: ¿Qué algoritmo debo usar? ¿Qué entorno debo emplear? ¿Cómo sé si el modelo realmente aprendió?

La personalización puede parecer desalentadora. Con modelos abiertos como la familia NVIDIA Nemotron 3—incluyendo Nano, Super y Ultra—combinados con plataformas como Prime Intellect Lab que ofrecen entrenamiento como servicio, el ciclo completo de personalización es mucho más accesible. En este tutorial, utilizarás Prime Intellect Lab para personalizar NVIDIA Nemotron 3 Nano con aprendizaje reforzado alojado y producir un adaptador LoRA descargable.

La configuración local toma unos cinco minutos, eso es todo. Al final de este artículo, aprenderás dos cosas: la personalización es más accesible que nunca y comenzar con modelos abiertos es más sencillo que antes.

¿Qué vas a construir?

Seguiremos un flujo simple para este tutorial: línea base, entrenamiento y reevaluación, todo usando Nemotron 3 Nano, resultando en un modelo personalizado para nuestra tarea. Para mostrar lo fácil que es comenzar con las herramientas de personalización robustas a nuestra disposición, usaremos un ejemplo estándar de "hola mundo": Python Math.

Este tutorial se aplica a Nemotron 3 Super y Nemotron 3 Ultra. El siguiente video le guiará a través de la tarea de codificación más compleja que forma parte de un notebook complementario a este tutorial:

¿Qué significa la personalización?

La personalización significa tomar un modelo y cambiar o adaptar sus parámetros entrenables para que sea más probable que realice con éxito los tipos de tareas que usted desea. Hay muchas formas de hacer esto. Dependiendo del problema, podría usar ajuste fino supervisado (SFT), ajuste fino eficiente en parámetros (PEFT), optimización de preferencias, aprendizaje reforzado o una combinación de técnicas. Para un tratamiento más amplio, consulte la publicación Selección de técnicas de personalización de LLM.

Este tutorial se centra en el aprendizaje reforzado con recompensas verificables (RLVR) en el entorno Python Math. La idea básica del entorno es simple: usar herramientas de Python (numpy, sympy y scipy) para realizar cálculos matemáticos. Aquí hay un ejemplo de una instrucción (prompt):

Código
# System: 
Use Python for all calculations. Give your answer inside \boxed{}.

In addition to the Python standard library, you have access to: numpy sympy scipy.

# User: 
If $2^8=4^x$, what is the value of $x$?
NOTA: El entorno tiene un valor predeterminado de 100 turnos. Para este experimento, limitamos cada despliegue a cinco turnos del asistente. Una respuesta directa es un turno, por lo que una llamada a herramienta con la respuesta final cuenta como dos de los 5 turnos. Esto penaliza fuertemente al modelo por llamar repetidamente a herramientas sin producir una respuesta final.

Para una introducción más profunda al aprendizaje reforzado para agentes, consulte la publicación Dominando técnicas agenticas: Aprendizaje reforzado de agentes de IA.

¿Por qué importa la apertura?

Los pesos abiertos son una parte importante de la ecuación, pero no son toda la ecuación. Los datos, el código de evaluación y las recetas de entrenamiento también determinan lo que puedes entender, reproducir y desplegar. La familia NVIDIA Nemotron 3 se publica con recursos de modelo abiertos, incluyendo pesos, datos y recetas. Puedes explorar los recursos para desarrolladores de NVIDIA Nemotron, leer Dentro de NVIDIA Nemotron 3 e inspeccionar el repositorio de NVIDIA Nemotron.

Estos recursos brindan una mejor visión de cómo se construyó y post-entrenó Nemotron, los tipos de datos y entornos que se utilizaron, y dónde debería diferir su propia personalización.

Requisitos previos

Para este tutorial, necesitarás:

  • Un entorno de desarrollo con curl y una instalación de Python 3 compatible.
  • Una cuenta de Prime Intellect con acceso a entrenamiento alojado y facturación configurada.
  • Acceso a Internet para la CLI de Prime, el paquete de entorno, el modelo alojado y el despliegue del adaptador.
  • Aproximadamente 5-15 minutos.

Prime Intellect maneja el despliegue, el entrenamiento y la infraestructura de inferencia; no necesitas gestionar un clúster de GPU local.

Nota: La disponibilidad y los precios de los modelos cambian con el tiempo. Trate el catálogo CLI en vivo como la fuente de la verdad en lugar de copiar un identificador o precio de un artículo estático.

Personaliza Nemotron 3 Nano en tres pasos

Entremos en los pasos simples necesarios para personalizar tu propio Nemotron 3 Nano.

Paso 1: Obtener una línea base

Primero, instala la CLI de Prime, autentícate y crea un espacio de trabajo de Prime Intellect Lab:

Código
curl -LsSf https://astral.sh/uv/install.sh | sh
uv python install 3.13
uv tool install --python 3.13 --force "prime==0.6.17"

uv --version
prime --version

prime login
mkdir -p nemotron-customization
cd nemotron-customization
prime lab setup
uv run python --version

Prime Intellect Lab crea la estructura del espacio de trabajo e instala las herramientas de verificación. Los pasos de evaluación y entrenamiento de mayor duración vienen a continuación.

Inspecciona el entorno antes de usarlo:

Código
prime env info primeintellect/math-python --version 0.1.10
prime env inspect primeintellect/math-python@0.1.10 README.md

Fija el paquete de entorno exacto en el espacio de trabajo:

Código
uv add "math_python==0.1.10" \
  --index https://hub.primeintellect.ai/primeintellect/simple/
uv lock --check

Ahora verifica el catálogo de entrenamiento alojado en vivo:

Código
prime train models
prime inference models

Vía NVIDIA Developer.