31 de julio de 2026 - Link Blog

Smevals - una suite de evaluación para modelos, prompts y harnesses. He estado trabajando junto al laboratorio de investigación de IA aplicada Prime Radiant de Jesse Vincent, desarrollando este framework de evaluación para ayudar a responder preguntas sobre las capacidades de distintos modelos.

El resultado es smevals, una nueva herramienta diseñada para ejecutar pequeñas suites de evaluación en diversas configuraciones de modelos y calificar los resultados obtenidos.

¿Cómo funciona Smevals en la práctica?

Esta entrada de blog describe la herramienta en detalle. Aquí está la versión rápida de 10 segundos:

  • Indique a su agente de programación que ejecute uvx smevals docs para aprender a usar la herramienta (esto genera el README).
  • Luego, pídale que construya una suite de evaluación para usted.

Una vez creada la evaluación —que toma la forma de un directorio con archivos YAML—, puede ejecutarla contra los modelos de la siguiente manera:

Código
uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6

Las ejecuciones se tratan de forma separada a las operaciones de calificación. Puede calificar sus ejecuciones (basándose en su conjunto de verificaciones definido) utilizando:

Código
uvx smevals grade path-to-eval/

Luego, puede ejecutar un servidor web en localhost para explorar los resultados:

Código
uvx smevals serve path-to-eval/

También puede ejecutar el comando smevals build para generar ese reporte como HTML estático, el cual puede alojar en cualquier lugar. Aquí hay un ejemplo que muestra una suite de evaluación que construí para evaluar qué tan bien pueden los modelos escribir haikus.

La herramienta ofrece una interfaz intuitiva para visualizar métricas de rendimiento y comparar respuestas entre diferentes arquitecturas de lenguaje en un solo panel de control.

El sistema permite organizar los resultados de forma jerárquica, facilitando la comparación visual de múltiples modelos evaluados bajo los mismos parámetros de entrada y condiciones de prueba.

He estado intentando encontrar un enfoque de evaluación que me satisfaga durante varios años. smevals es mi tercera iteración sobre esta idea y se siente correcta. Espero expandir esto más en el futuro, así como aplicarlo en algunos de mis propios proyectos.

Vía Simon Willison.