Los artículos de ciencia computacional publican código que el lector tiene que clonar, instalar, configurar y depurar antes de poder usarlo. Ese costo deja métodos útiles encerrados dentro de un PDF. Un equipo de Stanford encabezado por Jiacheng Miao y James Zou propone una salida. Paper2Agent se publicó en Nature el 16 de septiembre de 2026 y convierte un paper junto a su base de código en un servidor de Model Context Protocol. Desde ahí, cualquier agente compatible con MCP, por ejemplo Claude Code, puede correr los métodos del estudio conversando en lenguaje natural. Los autores describen el resultado como un autor de correspondencia virtual.
¿Se puede usar hoy? Sí. El código va con licencia MIT y se instala como una habilidad para Claude Code o Codex. Hay servidores ya construidos de AlphaGenome, Scanpy y TISSUE corriendo en Hugging Face Spaces, y también una versión alojada en paper2agent.ai.
¿Cómo funciona la tubería?
Paper2Agent corre sobre el SDK de agentes de Claude Code. Un orquestador central reparte el trabajo entre subagentes especializados en seis pasos:
- Ubicar y descargar la base de código.
- Un gestor de entornos construye un entorno virtual aislado.
- Un rastreador de tutoriales indexa los que se pueden aprovechar.
- Un ejecutor corre esos tutoriales de principio a fin y registra las salidas de referencia.
- Un extractor convierte los tutoriales en herramientas MCP parametrizadas, y un verificador de pruebas las valida.
- El orquestador arma las herramientas validadas en un único servidor MCP.
El filtro de validación es estricto. Una herramienta pasa solo cuando aparecen los archivos esperados y los números coinciden dentro de un margen de 3%. Las figuras, además, deben calzar con las de referencia mediante hash perceptual, con una distancia de Hamming bajo 20. El verificador dispone de hasta 6 intentos por función. Las herramientas que siguen fallando quedan fuera del servidor final.
Los tres componentes de cada servidor
Cada servidor expone tres piezas. Las herramientas MCP envuelven los métodos del paper como funciones ejecutables. Los recursos MCP guardan el manuscrito, los enlaces al código, los conjuntos de datos y las figuras. Los prompts MCP codifican flujos de varios pasos, como el orden correcto de preprocesamiento en Scanpy. El equipo de investigación usó Claude Sonnet 4 en todas las aplicaciones de Paper2Agent.
AlphaGenome, 22 herramientas por 14 dólares
Para AlphaGenome, Paper2Agent construyó 22 herramientas en unos 45 minutos a un costo de 14 dólares. Las 22 pasaron la validación sin intervención humana. El equipo comparó el agente contra Claude Code con acceso al repositorio y contra Biomni.
Los resultados abarcan 5 corridas, evaluadas por 2 expertos humanos con un acuerdo entre evaluadores de 96,7%. En consultas de tutorial, el tiempo de ejecución mediano cayó 1,9 veces frente a Claude con repositorio y 3,1 veces frente a Biomni. Las ganancias se mantuvieron cuando la línea base se actualizó a Claude Opus 4.6.
El agente también volvió a examinar una variante ligada al colesterol LDL, chr1:109274968:G>T. Ordenó a SORT1 como el gen causal más probable, mientras que el paper original de AlphaGenome había puesto el acento en CELSR2 y PSRC1. GTEx muestra eQTL hepáticos significativos para los tres genes. Según los investigadores, el episodio deja ver lo difícil que es asignar el gen causal en un locus así.
Scanpy, TISSUE y las pruebas a escala
El agente de Scanpy recibió 7 herramientas validadas en unos 45 minutos por 13 dólares. Sobre 4 conjuntos de datos públicos igualó a los investigadores humanos en conteo de células, conteo de genes y genes marcadores principales. Un agente de TISSUE reprodujo resultados humanos en datos de transcriptómica espacial.
Las pruebas a escala cubrieron tres corpus sin limpieza manual:
- 100 papers de biología computacional de bioRxiv. Se convirtieron 74, y 593 de 599 herramientas propuestas pasaron la validación.
- 300 preguntas. Paper2Agent obtuvo 91,2%, contra 80,3% (Sonnet 4) y 86,3% (Sonnet 4.6) de Claude con repositorio.
- Costo por consulta. 0,20 dólares y 1,6 minutos, frente a 0,38 dólares y 4,3 minutos de la alternativa.
- 10 papers fuera de la biología, entre ellos TabPFN, SAM 2 y SAELens. Alcanzó 98,1% de exactitud en 42 tareas de ejecución.
- 26 papers centrados en datos. La capa de recursos llegó a 89,0% contra 82,0% del uso de navegador, 34 veces más barato y 15 veces más rápido.
Paper2Agent además rechazó el 100% de las consultas fuera de alcance en una prueba con datos permutados, y se recuperó de fallas inyectadas de dependencias, rutas de archivo, errores de tipeo y APIs obsoletas.
¿Qué pasa cuando tres agentes trabajan juntos?
El equipo conectó tres agentes, el de AlphaGenome, uno construido sobre un tamizaje scCRISPRi acoplado a MPRA y otro sobre un conjunto de datos Perturb-seq de linfocitos T CD4+. AlphaGenome levantó la sospecha sobre GPR137 en el locus de psoriasis rs887314, con un puntaje de cuantil de RNA-seq de 0,997. El co-científico de IA propuso 10 estrategias de validación y un investigador eligió la correlación de firmas.
Solo el silenciamiento de GPR137 calzó con la firma de perturbación del elemento regulador. La coincidencia apareció bajo estimulación, con un Spearman de 0,613 a las 8 horas y de 0,630 a las 48 horas. BAD y otros 3 candidatos no mostraron correlación significativa. Un segundo estudio combinó AlphaGenome con un GWAS de déficit atencional y nominó a rs1626703 entre 209 candidatos. Esa hipótesis todavía necesita validación experimental.




