El anuncio más importante de la 37ª conferencia Hot Chips fue el avance de OpenAI con su propio chip, menos de un año después del acuerdo con Broadcom. La sorpresa es que no se trata de un ASIC acotado, sino de una alternativa que, según los números publicados, le gana a Blackwell.

La métrica que manda ahora es el rendimiento por watt, y ahí Jalapeño entrega.

Gráfico comparativo del rendimiento por watt de Jalapeño frente a los sistemas de NVIDIA
Gráfico comparativo del rendimiento por watt de Jalapeño frente a los sistemas de NVIDIA

¿Qué números publicó OpenAI sobre Jalapeño?

Los datos difundidos son la nota técnica más relevante del día. OpenAI liberó los primeros detalles de benchmark de Jalapeño, su chip de inferencia a medida, y reclama una eficiencia y una latencia claramente mejores que las de los sistemas GB200 y GB300 de NVIDIA sobre cargas reales de modelos.

En las pruebas de la propia empresa, Jalapeño entregó:

  • 1,5 a 1,9 veces más trabajo por watt en el máximo de throughput.
  • 1,7 a 3,6 veces menos latencia de punta a punta.
  • 2,1 a 4,1 veces más rendimiento en cargas altamente interactivas.

El chip está especificado en 700 W, pero se habría mantenido en 550 W o menos durante las corridas medidas. OpenAI señala que el despliegue en su propia infraestructura empieza antes de fin de año, con la generación 2 ya avanzada en desarrollo y la generación 3 en marcha (anuncio de OpenAI, hoja de ruta de despliegue, Sam Altman).

Métrica declaradaJalapeño frente a GB200/GB300
Trabajo por watt (peak throughput)1,5x a 1,9x
Latencia de punta a punta1,7x a 3,6x menor
Rendimiento en cargas interactivas2,1x a 4,1x
Consumo especificado700 W (medido en 550 W o menos)

¿Por qué les importa a los ingenieros?

Lo llamativo no es el rendimiento bruto, sino una arquitectura de inferencia más equilibrada que reduce el clásico compromiso entre throughput y latencia. Varias reacciones técnicas destacaron que algunos puntos de comparación son especialmente notables porque Jalapeño habría rendido bien incluso sin trucos como la desagregación agresiva de prefill y decode o el decodificado especulativo en ciertas configuraciones, ganándole a sistemas que sí los usaban (gdb, resumen de kimmonismus, análisis de eliebakouch, You Jiacheng). SemiAnalysis lo planteó como un resultado inusualmente fuerte para un ASIC de primera generación y lo comparó directamente contra sistemas de clase Blackwell y Rubin (SemiAnalysis, dylan522p).

Hay una historia de segundo orden: la optimización de sistemas asistida por modelos. La publicación de OpenAI indica que GPT-Astra y Codex ayudaron a escribir y optimizar kernels de bajo nivel, llevando tres modelos de pesos abiertos no planificados a alto rendimiento sobre Jalapeño en unos dos meses. Para bloques seleccionados de atención y de mezcla de expertos, esas implementaciones habrían corrido entre 1,5 y 1,8 veces más rápido que el código escrito por especialistas humanos (kimmonismus, eliebakouch).

En cuanto a la implicancia de infraestructura, varias publicaciones vinculan a Jalapeño con una transición mayor de la industria, en la que los laboratorios de frontera podrían dejar de depender estrictamente de NVIDIA para la economía de la inferencia, aunque el empaquetado y la capacidad de fundición sigan siendo un cuello de botella duro (Liam Fedus, reacción de teortaxesTex, advertencia de LearnOpenCV sobre la capacidad de TSMC y CoWoS).

El andamiaje de los agentes pasa a primer plano

Varios artículos y lanzamientos convergieron en la misma idea: el rendimiento de un agente depende mucho del sistema que lo rodea. Un paper liderado por Microsoft sobre AutoSaddler trata al andamiaje como código y parcha prompts, configuraciones de herramientas y lógica de control de manera offline usando trazas de fallas. Reporta mejoras de +9,0 en GAIA2, +9,6 en SWE-Bench Pro y +10,0 en Terminal-Bench 2.0 sobre los andamiajes base (resumen del paper).

En paralelo, otro trabajo cuantificó directamente la varianza del andamiaje y encontró que cambiarlo puede mover los puntajes mucho más que cambiar de modelo, al punto de invertir el orden entre pares de modelos. La solución propuesta es un estándar de divulgación llamado Harness Card (análisis, There Is No Neutral Harness).

La ingeniería de software de horizonte largo sigue sin resolverse. SWE Refactor Bench mide tareas de migración de repositorios completos, como C a Rust, Maven a Gradle y POSIX a WebAssembly, sobre proyectos reales que incluyen SQLite, zlib y libsodium. De 520 corridas, solo 28 sobrevivieron las tres etapas, una tasa de supervivencia de 5,4%, y 13 de 20 tareas no las resolvió nadie (EinsiaAI). Es un buen contrapeso frente a los números altos que se ven en benchmarks de corrección de errores más locales.

Memoria como estado programable, no como historial comprimido

Los sistemas de memoria se están rediseñando. Un paper de Alibaba resumido por DAIR respalda las sesiones de agente con un registro de eventos de solo anexado más un kernel de Python persistente, ligando salidas de herramientas y estado derivado a variables tipadas en lugar de serializarlas continuamente dentro del prompt. Los resultados informados incluyen 94,8% en LongMemEval_S, 73,1% en BEAM_10M (+5,1 sobre el mejor sistema de memoria publicado antes) y 86,7% en LOCA_256K con Qwen3.8-Max (resumen).

Un trabajo relacionado sobre Knowledge Triage mostró que la compactación ingenua de contexto destruye la retención de reglas exactas: tras cinco rondas de compactación, una configuración conservó apenas el 10% de las reglas de seguridad, mientras que las políticas de retención sensibles al tipo preservaron entre 2 y 4 veces más (resumen).

La ingeniería de evaluaciones también se está formalizando. LangChain y sus socios compartieron un circuito concreto para convertir trazas y retroalimentación humana en especificaciones de tareas, entornos sintéticos y evaluaciones que sirven para medir y post-entrenar agentes en el tiempo (Vtrivedy10, hwchase17). LangSmith Engine, además, reportó más del doble de rendimiento en benchmarks internos clave, con mejor detección y agrupación de incidencias, soporte SaaS y autohospedado, integraciones con Slack y Linear, y modos de análisis por nivel de costo (LangChain).

¿Qué tan local puede ser un agente hoy?

El lanzamiento más claro de producto con agentes locales fue Portable Computer, de Perplexity, sobre NVIDIA DGX Spark. Se presenta como una versión totalmente local de Perplexity Computer, donde el modelo orquestador, el modelo subagente y el andamiaje del agente corren en hardware propio, sin dependencia de la nube (lanzamiento de Perplexity, detalles de los modelos, NVIDIA, Arav Srinivas). La pila local inicial usa un PPLX 27B post-entrenado, con Qwen 3.8 27B también disponible, y soporte de Nemotron 3.5 Lightning en camino.

La tendencia de fondo son los agentes locales persistentes y siempre encendidos. Srinivas describió un futuro de procesos en segundo plano que ingieren contexto desde conectores de forma continua, razonan en varios saltos dentro de un bucle perpetuo y corren en hardware del propio usuario (Arav Srinivas). Las reacciones de la comunidad se dividieron entre el entusiasmo por la privacidad y el control, y el escepticismo de que "local primero" signifique un DGX Spark de 5.000 dólares y no un equipo de consumo masivo (crítica de theo, seguimiento).

Ese detalle importa en Chile y el resto de la región: un DGX Spark de 5.000 dólares antes de impuestos y flete queda muy lejos del presupuesto de un laboratorio universitario promedio, mientras que la misma idea de agente local se puede prototipar hoy sobre placas de inferencia de borde que cuestan una fracción de eso. La discusión sobre "local primero" en LatAm no es de arquitectura, es de precio de entrada.

En el mundo Apple, el herramental local también madura. La empresa exo afirmó que Apple la destacó en las páginas del nuevo Mac Studio con M5 Ultra y de los Mac Mini con M6 y M5 Pro, con énfasis en RDMA de baja latencia sobre Thunderbolt 5 para agrupar equipos Mac y correr modelos como Kimi K3 y GLM-5.3 a velocidades comparables a las de una API. Con cuatro M5 Ultra el escalamiento llega a cerca de 4,8 TB/s de ancho de banda de memoria agregado (exo). Otras publicaciones apuntan al almacenamiento PCIe más rápido de Apple y a los flujos de visión basados en ANE como habilitadores de clústeres locales pequeños e inferencia mixta entre CPU, ANE y GPU (anemll, onirenaud).

El herramental sigue completándose alrededor de los runtimes locales: Ollama v0.33 agregó una integración de un solo interruptor para que Claude Desktop use Ollama como pasarela de terceros hacia modelos locales y en la nube (Ollama), y se mostró OpenCode v2 corriendo dentro de un Cloudflare Durable Object, una señal de cuánto se están volviendo empotrables los runtimes chicos de agentes en entornos de borde (fayazara).

Modelos, recuperación e infraestructura de búsqueda

Qwen 3.8 aparece por toda la pila. El entusiasmo por su lanzamiento se vio tanto en publicaciones de despliegue como de evaluación: Together sumó ajuste fino y soporte de inferencia dedicada para Qwen3.8-27B (Together), y Unsloth aseguró haber logrado ajuste fino QLoRA completo del modelo de 27B en instancias gratuitas de Kaggle con dos Tesla T4, usando kernels optimizados (danielhanchen). Del lado de aplicación, Qwen3.8-27B llegó al primer lugar entre modelos abiertos en la Image-to-WebDev Arena y al séptimo lugar general, con un precio de 0,40 dólares por millón de tokens de entrada y 3 dólares por millón de salida (arena).

La infraestructura de búsqueda y recuperación también tuvo novedades sustantivas. Hugging Face publicó una descripción detallada de la arquitectura del motor de búsqueda de Papers with Code: PostgreSQL con pgvector, Qwen 3 Embedding 0.6B, recuperación híbrida, embeddings generados en una NVIDIA L4 mediante Hugging Face Jobs, artefactos en buckets y servicio en vivo a través de Inference Endpoints. La misma pila alimenta la sección de artículos relacionados en las páginas de cada paper (Niels Rogge). Keenable salió del sigilo con una API de búsqueda web y un lenguaje de consulta web para IA, construidos por exlíderes de búsqueda de Yandex y respaldados por una ronda semilla de 26 millones de dólares, con foco explícito en recuperación web a escala de agentes (styskin).