[AINews] GPT-5.6 reduce precios entre 20% y 80%: el costo de la inteligencia de GPT-5.4 cae 13 veces en 4 meses mediante auto-optimización recursiva

¡La destilación es todo lo que necesitas!

Uno de nuestros principales gráficos de referencia hace un año (eventualmente adoptado por Demis) observó de forma sorprendente que, manteniendo constante el Elo de LMSys, la inteligencia nivel GPT-4 cayó 1000 veces en 18 meses:

Gráfico que muestra la caída exponencial en el costo de la inteligencia nivel GPT-4 a lo largo de 18 meses
Gráfico que muestra la caída exponencial en el costo de la inteligencia nivel GPT-4 a lo largo de 18 meses

En aquel entonces, no estaba claro si se trataba de "ganancias de principiante": pasar de lo no optimizado a lo optimizado, de completaciones a razonamiento, o de modelos densos a MoE, con todos los frutos al alcance de la mano ya recolectados. 18 meses después, parece que la respuesta es no; la inteligencia de nivel constante sigue abaratándose precipitadamente.

Ayer, OpenAI publicó hallazgos sobre cómo GPT-5.6 optimizó su propio servicio:

1. Aceleración de inferencia

Para servir más tokens en el mismo hardware sin sacrificar calidad, OpenAI se centró en varias actualizaciones sistémicas:

  • Auto-optimización: GPT-5.6 Sol fue utilizado activamente para analizar el tráfico de producción, ajustar el balanceo de carga y reescribir autónomamente los kernels de producción en los lenguajes Triton y Gluon propios de OpenAI. Esta optimización autónoma de kernels redujo los costos de servicio de extremo a extremo en un 20%.
  • Decodificación especulativa: Mejoró su propio modelo de borrador (diseñando y ejecutando cientos de experimentos en su arquitectura, probando cambios en tamaño, estructura y características, mientras monitoreaba el proceso de entrenamiento del especulador e interviniendo autónomamente cuando surgían problemas, incluyendo fallas de hardware e inestabilidad en el entrenamiento), aumentando la eficiencia de generación de tokens en más de un 15%.
  • Caché KV: Optimizó el procesamiento por lotes (batching), la fragmentación (sharding) y la gestión de caché específica para diferentes cargas de trabajo (principalmente Sol en Codex) para extraer más inferencia del hardware existente.

2. Mejoras en el harness de agentes

Para agilizar las tareas complejas y de múltiples pasos en herramientas como Codex y ChatGPT Work, OpenAI optimizó su capa de orquestación en Rust para reducir los costos de cómputo repetitivos:

  • Evitar la saturación del contexto: Las herramientas, habilidades y plugins solo se muestran cuando es necesario (descubrimiento diferido), y las salidas de las herramientas están limitadas a 10,000 tokens por defecto para evitar que la ventana de contexto se expanda innecesariamente.
  • Caché de prompts: Para evitar reprocesar las mismas instrucciones e historial repetidamente, el harness trata todo el historial visible del modelo como de solo adición (append-only). Esto preserva el prefijo del prompt, permitiendo al sistema reutilizar datos calculados previamente y mantener una alta tasa de aciertos de caché.

Hoy demostraron que no era solo teoría, anunciando grandes recortes de precios para los modelos más pequeños y un nuevo modo 2.5 veces más rápido en Sol (aunque no el modo impulsado por Cerebras 10 veces más rápido prometido en julio).

Esa es una hermosa curva de Pareto; si el Costo por Tarea de AA refleja las tareas del mundo real, entonces OpenAI ha superado incluso a modelos abiertos como DeepSeek, GLM y MiniMax, y a modelos dedicados baratos pero buenos como Gemini Flash-Lite.

Bien, pero lo que es verdaderamente asombroso es la observación de Nicdunz:

GPT-5.4 full en xhigh obtuvo 51 puntos, exactamente donde se ubica hoy Luna max. GPT-5.4 cuesta $2.50/$15; Luna ahora cuesta $0.20/$1.20. En otras palabras, aproximadamente cuatro meses después, OpenAI está vendiendo la inteligencia insignia de marzo a aproximadamente un treceavo del precio por token.

Esa es una tasa anualizada de aproximadamente 2000 veces al año, una aceleración enorme desde nuestra última observación, la cual DEBERÍAS descontar porque todos los benchmarks públicos como los de AA se entrenan hasta cierto punto, mientras que los Elo son menos entrenables directamente. Aunque los modelos abiertos líderes chinos y estadounidenses como Laguna de Poolside e Inkling de Thinky ofrecen control total y soberanía, si tu único objetivo es una inteligencia rentable sin ajuste fino, te resultará muy difícil superar a OpenAI en este momento.

Noticias de IA para el 29/07/2026 al 30/07/2026. Revisamos 12 subreddits, 544 cuentas de Twitter y no hubo más Discords. El sitio web de AINews te permite buscar todos los números anteriores. Como recordatorio, AINews es ahora una sección de Latent Space. ¡Puedes activar/desactivar las frecuencias de correo electrónico!

Resumen de AI Twitter

Recortes de precios de OpenAI, semántica del harness y el debate sobre la memoria ARC-AGI-3

  • OpenAI redujo agresivamente los precios de GPT-5.6 y añadió un nivel Sol más rápido: OpenAI redujo GPT-5.6 Luna en un 80% y Terra en un 20%, mientras introducía Sol Fast con hasta 2.5 veces menor latencia por el doble del precio estándar con "ningún cambio en la inteligencia", según @OpenAIDevs. El efecto derivado es notable para los flujos de trabajo de agentes: la revisión automática en la aplicación ChatGPT y Codex CLI está pasando de GPT-5.4 a Luna, y OpenAI espera un costo aproximadamente 10 veces menor. Múltiples observadores enmarcaron esto como un cambio significativo en la frontera de precio/rendimiento, incluyendo a @sama, @nicdunz y @kimmonismus. OpenAI también vinculó los recortes a mejoras de eficiencia a nivel de sistema que abarcan "modelo, stack de inferencia y harness de agentes", según @OpenAIDevs.
  • ARC-AGI-3 enfatizó que "el modelo" no es todo el sistema: La discusión técnica sobre evaluación se centró en el diseño del harness, la retención de memoria y la compactación de contexto. François Chollet aclaró las reglas de ARC: los harnesses personalizados específicos para benchmarks no están permitidos, pero las características de API de propósito general disponibles para todos los usuarios son aceptables si se informan la configuración y el costo. Un resumen detallado de @kimmonismus contrastó a Opus 5 con un 30.2% en la configuración oficial semiprivada de ARC frente a GPT-5.6 Sol con un 7.8% bajo el harness estándar, señalando que el uso interno de OpenAI de la API Responses con razonamiento + compactación elevó el puntaje de Sol en el conjunto público a 38.3%. La conclusión, respaldada por @gneubig, @scaling01 y otros: las evaluaciones de largo horizonte miden cada vez más el sistema de agentes completo (retención de razonamiento, política de truncamiento, compactación, orquestación de herramientas), no solo los pesos base.

Inkling-Small de Thinking Machines y el continuo impulso de los pesos abiertos

Vía Latent Space.