Un agente de IA rinde tanto como el contexto que recibe. Incluso con modelos capaces y librerías bien documentadas, un agente puede gastar pasos de más buscando la herramienta correcta, quemar tokens en callejones sin salida o trabarse en tareas especializadas. Las skills, o habilidades, empaquetan las instrucciones, los ejemplos y la guía de uso de herramientas para que el agente vaya más rápido desde la intención hasta la solución. Para medir si esas habilidades realmente mejoran el recorrido y el resultado, NVIDIA construyó una capa de evaluación abierta.

SkillEvaluator es una herramienta de código abierto que mide cómo afectan las habilidades al rendimiento del agente, mediante verificaciones estáticas y corridas de tareas reales con y sin cada habilidad instalada. Las skills verificadas de NVIDIA son descriptores de capacidad empaquetados y firmados que le indican al agente qué hace exactamente un producto de la compañía, cuándo invocarlo y cómo llamarlo. La parte verificada es justamente la medición que determina que está lista.

El informe entrega los primeros resultados para más de 300 habilidades verificadas repartidas en más de 30 productos de NVIDIA. Cada una se evaluó en dos entornos independientes, y para cada entorno se calculó el Skill Lift comparando los puntajes de las corridas con y sin la habilidad instalada.

NVIDIA publica complementos para Claude Code, Codex y Cursor, y las mismas habilidades están disponibles a través de Skills.sh, ClawHub y Hermes Hub.

¿Cómo se evalúa una habilidad?

Antes de publicarse, cada habilidad pasa por tres niveles de evaluación. Cada uno responde una pregunta distinta y cada uno puede correr por separado.

  • Nivel 1, seguridad y estructura: verificaciones estáticas de esquema y encabezado, puntaje de calidad, escaneo de seguridad contra inyección de instrucciones y exfiltración de datos, detección de secretos y datos personales, revisión de licencias y análisis estático de los scripts.
  • Nivel 2, distintividad: usa similitud de embeddings para detectar guía duplicada dentro de una misma habilidad y cobertura superpuesta entre distintas habilidades del catálogo.
  • Nivel 3, evaluación en vivo: corre una evaluación real con un agente contra tareas generadas, una vez con la habilidad instalada y otra sin ella, dentro de un entorno aislado, y mide la diferencia.

Las evaluaciones de nivel 3 usan Harbor, un marco de trabajo abierto para correr evaluaciones de agentes en entornos repetibles y aislados. SkillEvaluator se encarga de la configuración: convierte los casos de evaluación en tareas, corre los agentes en cajas de arena, recolecta los resultados y calcula el impacto de la habilidad.

Todo resultado sale de una comparación controlada. Para cada caso, el entorno del agente corre dos veces, una con la habilidad verificada instalada y otra sin ella. Cada corrida se ejecuta en su propia caja de arena, con el mismo prompt, el mismo modelo, las mismas entradas y los mismos criterios de calificación. Dentro de cada entorno, la única variable experimental es si la habilidad está instalada o no.

Un ejemplo simple

Primero se genera un conjunto de datos de evaluación para la habilidad:

Código
skillevaluator create-eval-dataset ./my-skill --full

Esto crea evals/evals.json. Cada caso incluye un identificador, un prompt y una salida esperada, más aserciones opcionales. Con --full, el conjunto incluye casos explícitos, implícitos, contextuales y negativos.

Tras revisar los casos, se corre la comparación en vivo:

Código
skillevaluator tier3 evaluate ./my-skill \
  --agents codex \
  --env-mode docker

SkillEvaluator convierte los casos en un paquete de tareas de Harbor, corre cada caso con y sin la habilidad, califica ambas corridas y entrega los puntajes y el Skill Lift. La documentación de evaluación en vivo cubre el flujo completo.

¿Cuánto sube realmente el rendimiento?

Todas las cifras corresponden a la instantánea del 12 de agosto de 2026 del archivo benchmarks.json. Los puntajes son promedios macro sobre los pares habilidad-entorno publicados, dando el mismo peso a cada par. El Skill Lift es el puntaje con habilidad menos el puntaje sin habilidad, medido en puntos.

Sin la habilidad instalada, los puntajes base promedio quedaron entre 39 y 46 sobre 100 en corrección, descubribilidad, efectividad y eficiencia. La seguridad fue la excepción, con un puntaje base promedio de 97: ahí el objetivo principal era verificar que instalar una habilidad no introdujera una regresión.

DimensiónSin habilidadCon habilidadSkill Lift
Corrección4687+41
Efectividad3978+39
Descubribilidadcerca de 42+40
Eficienciacerca de 43+35
Seguridad97ganancia menor

En corrección y efectividad, las dos dimensiones medidas de forma consistente en ambas condiciones, los promedios subieron de 46 a 87 y de 39 a 78. Esos puntajes no son estimaciones de probabilidad de éxito: muestran un rendimiento promedio mayor en las tareas especializadas evaluadas.

Descubribilidad y eficiencia arrojan valores de 40 y 35 puntos, pero se puntúan contra la habilidad misma, así que deben leerse como evidencia de que el agente activa y usa correctamente la habilidad una vez instalada, y no como una medida del comportamiento del agente por su cuenta. Esa propiedad importa: cada habilidad presente en un entorno compite por la atención del agente, y una que se carga cuando no corresponde puede empeorar el rendimiento.

Los límites que el propio informe reconoce

Corrección, efectividad y seguridad miden el resultado de la corrida, así que sus valores base reflejan lo que el agente puede hacer sin la habilidad. Descubribilidad y eficiencia miden además cómo se usa la habilidad: si el agente la encuentra, si la lee antes de actuar y si evita pasos innecesarios. Sin la habilidad, esas acciones no están disponibles. Aun así el agente puede sumar puntos por uso productivo de herramientas y por dejar correctamente sin cargar la habilidad en tareas no relacionadas, lo que explica que los valores base ronden 42 y 43 en vez de cero.

La mayoría de las habilidades se evaluó con un solo intento por tarea: 85% corrió un intento y 15% corrió dos. Las corridas de agentes en vivo varían entre ejecuciones, así que los puntajes individuales fluctúan. Los promedios del catálogo agregan miles de pruebas, pero el informe no reporta intervalos de confianza.

Tres hallazgos prácticos

El conjunto de evaluación importa más que la habilidad. Los equipos que definen con claridad las tareas relevantes, las salidas esperadas y las solicitudes fuera de alcance producen señales más nítidas, y eso ocurre antes de que corra cualquier agente. Una habilidad solo se puede medir con la precisión con que su conjunto de evaluación describe el trabajo.

El producto pesa más que el agente. El Skill Lift varía mucho más entre productos que entre entornos. Claude Code y Codex difieren en unos 5 puntos en promedio, mientras que el Skill Lift por producto va desde alrededor de +2 hasta +46. El dominio, la tarea y el diseño de la evaluación importaron más que el entorno elegido.

El ahorro de tokens no es automático. SkillEvaluator registra el uso de tokens por separado de la eficiencia. En dos ejemplos de un solo intento, la habilidad jetson-optimize-memory redujo el consumo de 617.306 a 142.540 tokens, un 76,9% menos, y el tiempo de ejecución de 474,9 a 220,0 segundos, un 53,7% menos. En sentido contrario, cuopt-install aumentó el consumo de 25.227 a 55.582 tokens, un 120,3% más, y el tiempo de 34,0 a 41,1 segundos, un 20,8% más, lo que identifica una oportunidad concreta de optimización.

Ese contraste tiene una lectura directa para quien trabaja con cómputo acotado, que es la norma en la región: la habilidad que más ahorró es precisamente la de optimización de memoria en Jetson, la plataforma de borde que se usa en integraciones industriales y en robótica móvil. Una reducción de 76,9% en tokens sobre una tarea recurrente cambia el costo operativo de un equipo pequeño, mientras que instalar habilidades sin medirlas puede duplicar la factura sin que nadie lo note.

Pilotos con socios externos

OpenClaw está probando SkillEvaluator para organizaciones oficiales en ClawHub. La integración corre evaluaciones de nivel 3 y muestra los resultados con y sin habilidad en una pestaña de evaluaciones, de modo que quien desarrolla pueda revisar las señales en el mismo lugar donde descubre y adopta habilidades.

Nous Research probó SkillEvaluator en Hermes Agent con un escaneo consultivo opcional de SkillSpector dentro del flujo de instalación. La integración revisa datos personales, contrabando de caracteres Unicode, análisis estático de scripts, licencias y problemas de seguridad, y expone los hallazgos con archivo y línea antes de instalar. El flujo está cubierto por 29 pruebas y cada escaneo toma aproximadamente 1,4 a 1,5 segundos.

Para empezar están la documentación de SkillEvaluator y el catálogo de habilidades verificadas en GitHub.