La IA agéntica está cambiando la forma en que se hace investigación. Los agentes científicos pueden leer artículos, proponer hipótesis, invocar modelos y determinar qué experimentos priorizar. Después de probar su valor en ingeniería de software, donde ya escriben, prueban y despachan código de producción, el desafío es la investigación científica, que es más exigente e iterativa: los investigadores evalúan evidencia de forma continua, refinan hipótesis y corren experimentos que condicionan las decisiones siguientes. Incluso los experimentos fallidos pueden entregar hallazgos inesperados.

Los problemas científicos suelen requerir herramientas específicas del dominio, por ejemplo para plegar una proteína o caracterizar una molécula. Operar y coordinar esas herramientas es difícil, porque paquetes similares pueden tener requisitos de entorno o interfaces de programación completamente distintos. Un agente de propósito general puede reconocer que una tarea exige plegado de proteínas o acoplamiento molecular, pero no qué modelo ejecutar, cómo formatear la solicitud ni qué parámetros importan.

¿Qué aporta el BioNeMo Agent Toolkit?

El NVIDIA BioNeMo Agent Toolkit cierra esa brecha. La herramienta empaqueta más de una década de modelos, bibliotecas y flujos de trabajo de ciencias de la vida de NVIDIA BioNeMo como habilidades invocables por agentes en biología, química, genómica y descubrimiento de fármacos.

Está construido para funcionar con cualquier marco de agentes. Según pruebas internas de NVIDIA, las habilidades de BioNeMo elevan la corrección de las tareas del 60% al 100% y aproximadamente duplican la eficiencia de tokens.

La demostración usa Claude Science, el banco de trabajo de investigación científica de Anthropic, junto con el BioNeMo Agent Toolkit y los microservicios NVIDIA NIM, para correr predicción de estructura de proteínas con alineamiento múltiple de secuencias (MSA) usando varios modelos de plegado y comparar resultados.

¿Qué hardware y almacenamiento exige?

NVIDIA y Anthropic trabajaron en conjunto para integrar el kit en Claude Science, de modo que los agentes puedan descubrir, lanzar e invocar los microservicios BioNeMo NIM de forma directa.

El requisito de entrada no es menor. Se necesita una estación de trabajo o una máquina en la nube con una GPU NVIDIA L40S o H100 y Claude Science instalado. La máquina requiere cerca de 700 GB de almacenamiento para este flujo: la base de datos UniRef30 del servicio msa-search ocupa unos 490 GB (usando el perfil que descarga sólo UniRef30 en lugar del conjunto completo de 1,4 TB), y los contenedores de Boltz-2 y OpenFold3 suman entre 30 y 40 GB.

Por defecto Claude Science corre en un entorno aislado. Para ejecutar los microservicios hay que habilitar recursos de GPU locales o remotos desde Customize > Compute > NVIDIA BioNeMo NIM > Connect, importar las habilidades del kit desde GitHub, agregar una clave de API de NVIDIA y conectar contenedores Docker que usen la GPU del anfitrión.

Figura 1. Las habilidades de BioNeMo en Claude Science coordinan la generación de MSA y la predicción de estructura con los servicios MSA Search, OpenFold3 y Boltz-2
Figura 1. Las habilidades de BioNeMo en Claude Science coordinan la generación de MSA y la predicción de estructura con los servicios MSA Search, OpenFold3 y Boltz-2

El caso de estudio: dos proteínas de un hongo

El tutorial examina la proteína Seh1 y un socio propuesto de la familia Mio en Paracoccidioides lutzii, el hongo que causa la paracoccidioidomicosis. El ejemplo se inspira en la figura 4e del trabajo de Han, Tsenkov, Venanzi y otros, "AlphaFold Database expands to proteome-scale quaternary structures" (bioRxiv, DOI: 10.64898/2026.03.27.714458).

Seh1 y las proteínas de la familia Mio participan en maquinaria conservada de detección de nutrientes, y estructuras de otros organismos sugieren que Mio puede completar la hélice beta que en Seh1 queda abierta. Eso convierte a esta pareja en una buena prueba de predicción de complejos apoyada en MSA. El sistema usa la proteína del poro nuclear Seh1 (accesión C1GY11, 384 residuos) y un socio propuesto sin caracterizar (C1HCX1, 976 residuos).

El flujo tiene tres etapas: generar los alineamientos para cadenas individuales y para secuencias emparejadas por especie con el servicio acelerado por GPU; predecir la estructura de una cadena y de un complejo de dos cadenas con OpenFold3; y repetir las predicciones con Boltz-2 evaluando cada modelo por separado.

En esta corrida la búsqueda devolvió 202 secuencias para cada proteína. El agente registró origen, secuencia y sumas de verificación, sin recortar las secuencias ni entregar plantillas estructurales, ligandos u otras restricciones.

Una diferencia arquitectónica importa: Boltz-2 no tiene un campo separado paired_msa. Toma un MSA por cadena y hace el emparejamiento internamente, así que cada cadena recibió su propio archivo A3M.

El alineamiento es la pieza que sostiene todo

Como el flujo también corrió predicciones sin MSA, el valor de la primera etapa se puede medir de forma directa. Para el complejo de dos cadenas, el iPTM, la métrica que informa sobre el contacto predicho entre ambas cadenas, se derrumba sin alineamiento en los dos modelos.

Figura 2. iPTM del heterómero con y sin MSA para OpenFold3 y Boltz-2 en cinco muestras por condición
Figura 2. iPTM del heterómero con y sin MSA para OpenFold3 y Boltz-2 en cinco muestras por condición

Con MSA, el iPTM alcanza 0,85 en OpenFold3 y 0,82 en Boltz-2. Sin MSA cae a 0,14 y 0,19 respectivamente. Las cinco muestras se agrupan de forma estrecha (desviación estándar menor o igual a 0,006), lo que indica que la diferencia es consistente.

Dos controles de robustez respaldan el resultado. Primero, al correr cada condición con un presupuesto de muestreo más generoso, el panorama no cambia: la interfaz con MSA se mantuvo alta y la interfaz sin MSA siguió colapsada, con diferencias menores a 0,01 de iPTM. Más muestreo no reemplaza a la información evolutiva. Segundo, las dos familias de modelos, con arquitecturas distintas y mecanismos de emparejamiento diferentes, quedan a menos de 0,03 de iPTM entre sí cuando reciben el alineamiento, lo que constituye una coincidencia tranquilizadora entre modelos.

Un detalle de lectura que conviene no olvidar: el iPTM del monómero es 0 por construcción, y el puntaje compuesto de OpenFold3 pondera fuertemente la interfaz. Por eso un monómero bien plegado (pTM 0,82 y pLDDT 82) igual obtiene un compuesto bajo. Ese puntaje se lee dentro de OpenFold3, no entre modelos distintos.

Boltz-2, por su parte, devolvió un conjunto de confianza más rico, con matrices completas de error predicho que llegan hasta 1.360 por 1.360 para el complejo.