La simulación atomística depende de tres cosas: saber qué se quiere simular, contar con una implementación eficiente en cómputo y tener interfaces accesibles hacia esa maquinaria. La primera sigue siendo dominio del investigador. La segunda la resolvió en buena parte el ALCHEMI Toolkit de NVIDIA, liberado a comienzos de 2026. La tercera es la que la compañía acaba de poner a prueba con agentes de programación, y los resultados llegan con números.
NVIDIA generó y ejecutó 45 flujos de simulación completos a partir de descripciones en lenguaje natural, con validación posterior sobre GPU NVIDIA H200. El hallazgo central es contraintuitivo: el nivel de especificidad del prompt cambió la estructura del código y su costo, pero nunca la física del resultado.
¿Qué hace exactamente el ALCHEMI Toolkit?
Es una biblioteca nativa de PyTorch con bloques componibles para construir simulaciones aceleradas por GPU sobre potenciales interatómicos de aprendizaje automático (MLIP, por su sigla en inglés), con procesamiento por lotes en vuelo. A diferencia de los campos de fuerza clásicos, el ecosistema MLIP es todavía incipiente y corre sobre un stack de software distinto al que acostumbran los químicos computacionales, con otras estructuras de datos y otras dependencias.
Ahí aparece el problema que motivó el estudio. Un agente de propósito general no conoce la API del toolkit y puede producir código que parece correcto sin serlo. La respuesta de NVIDIA fueron las agent skills y los archivos de referencia que entregan los patrones de la API bajo demanda, para que el prompt se ocupe solo de la ciencia: el material, las condiciones y las restricciones del protocolo.
¿Qué se necesita para replicarlo?
Los requisitos publicados son concretos y marcan el piso real de entrada:
- Python 3.11 o superior, bajo 3.14
- PyTorch 2.8 o superior
- CUDA 12 o CUDA 13, con driver NVIDIA 570 o posterior
- GPU NVIDIA RTX 20xx o más nueva, con capacidad de cómputo 7.0 o superior
- Mínimo 4 GB de RAM, 16 GB recomendados para sistemas grandes
- Linux como sistema principal, macOS soportado
Ese listado esconde un dato que el anuncio no destaca: aunque la validación corrió sobre H200 de centro de datos, el requisito mínimo declarado es una tarjeta de escritorio de la generación RTX 20xx. Para un laboratorio universitario latinoamericano eso mueve la barrera desde el cómputo de arriendo por hora hacia una estación de trabajo propia, al menos para el trabajo exploratorio.
La instalación se hace con el gestor uv sobre un entorno virtual, seguida de la descarga de las skills desde la misma etiqueta de versión para que coincidan con la API instalada. El agente usado en el estudio fue Claude Code, aunque NVIDIA aclara que sirve cualquier agente compatible con el estándar abierto de Agent Skills, incluidos Cursor y OpenCode, según la guía de usuario.
El detalle del prompt cambia el costo, no el resultado
NVIDIA probó cinco niveles de especificidad, desde el más escueto hasta un contrato completo de línea de comandos.

Los prompts que nombraban material, método y escala obtuvieron el mejor puntaje. Los contratos completos de línea de comandos lograron reutilización total, pero costaron cerca de 4 veces más tokens y produjeron 2,3 veces más código. Los prompts de tipo especificación resultaron los más frágiles: concentraron tres de las siete fallas de tamizaje.
Las fallas de física que sí aparecieron vinieron de subespecificar el sistema. Pedir "una propiedad de transporte de un material de litio" produjo una demostración con argón, y dos scripts de cobre usaron convenciones de referencia distintas, con efecto material sobre el resultado. Los scripts sin instrucción de termostato usaron dinámica de Langevin en producción, que amortiguó la difusión entre 3 y 5 veces; pedir el conjunto NVE corrigió cada uno de ellos.
Un cuarto principio quedó explícito en el informe: los agentes nunca cuestionaron si la propiedad pedida estaba bien planteada desde la física.
"Pida explícitamente verificación de premisas, validación y estimaciones de incertidumbre, y exija recuperar un resultado independiente conocido: el agente no lo agregará por su cuenta", señala NVIDIA en su publicación técnica.
¿Qué tan cerca quedaron los resultados de las referencias?
Los 45 scripts usaron ejecución por lotes en GPU. Treinta y ocho pasaron el tamizaje y los 15 representantes de producción completaron su corrida.

En el caso del silicio cúbico diamante, el agente construyó siempre el mismo flujo: entre 50 y 60 volúmenes deformados relajados en paralelo como un único lote de GPU, seguidos de un ajuste de Birch-Murnaghan. Los cinco representantes de producción coinciden hasta el último dígito.
| Magnitud | Resultado ALCHEMI | Referencia |
|---|---|---|
| Constante de red a0 del silicio | 5,4661 Å | dentro de la ventana PBE de todos los electrones |
| Módulo volumétrico B0 | 88,15 GPa | contrastado con las mediciones de McSkimin |
| Adsorción de O en Cu(111), sitio fcc | -4,799 ± 0,004 eV | -4,31 eV a 0,25 monocapa |

En la adsorción de oxígeno sobre Cu(111), todos los representantes de producción encontraron el hueco fcc como el más estable, con el orden fcc mayor o igual que puente, sobre hcp y muy por encima del sitio superior. Los estudios de microcalorimetría de cobre de Giamello y de Naumann d'Alnoncourt reportaron valores entre -4,46 y -4,60 eV. Las diferencias de cobertura y el error del modelo pueden explicar el enlace más fuerte que obtuvo la simulación.

La coincidencia en el orden de los milielectronvolt entre scripts independientes es, según NVIDIA, lo que compra declarar una convención de referencia explícita en el prompt.
Dónde sigue mandando el criterio humano
El propio informe pone los límites. Los modelos MLIP como MACE-MPA-0 muestran precisión variable fuera de su dominio de entrenamiento, y los agentes de programación no verifican por sí solos la plausibilidad física de lo que se les pide. La validación independiente contra datos experimentales o de DFT sigue siendo indispensable.
Un detalle metodológico vale la pena para quien vaya a intentarlo: dejar que el agente ejecute lo que escribe elimina casi todos los errores mecánicos antes de que el investigador vea el script. En la campaña final de 45 flujos, esa configuración no produjo ninguna importación rota ni referencia a APIs inexistentes. Sin acceso a una shell ejecutable, leer el código fuente del repositorio funcionó como respaldo y eliminó importaciones rotas a lo largo de 617 sentencias de importación. La configuración más débil fue instalar con pip sin shell ni código fuente disponible.




