OpenAI liberó la vista previa de Ultrafast, un modo de inferencia que entrega hasta 750 tokens de salida por segundo desde su modelo insignia, GPT-5.6 Sol. La cifra representa cerca de 14 veces el rendimiento de la modalidad estándar del mismo modelo.

La aceleración proviene de Cerebras, la compañía de hardware que firmó a comienzos de este año una alianza de 10.000 millones de dólares con OpenAI. El servicio parte disponible únicamente a través de la API de OpenAI, solo para GPT-5.6 Sol y acotado a clientes seleccionados. La empresa planea ampliar el acceso de forma gradual a medida que crezca la capacidad, y quienes quieran entrar pueden inscribirse en un formulario para recibir novedades.

¿Para qué sirve tanta velocidad?

OpenAI sostiene que Ultrafast busca combinar la rapidez de los modelos pequeños con las capacidades completas de un modelo grande de razonamiento, algo que la compañía resume como "más trabajo útil por segundo".

El caso que la propia empresa dice estar usando internamente es la respuesta a incidentes: durante una caída de servicio, los ingenieros pueden hacer analizar registros, cambios de código e informes mientras el problema sigue ocurriendo, lo que ayuda a ubicar la causa y preparar el arreglo en tiempo real.

La compañía propone otros tres escenarios:

  • Finanzas: evaluar señales de mercado y marcar transacciones sospechosas mientras las condiciones todavía se mueven.
  • Atención al cliente: resolver consultas complejas en tiempo real, incluso cuando la respuesta exige varios pasos o consultar distintos sistemas.
  • Comercio electrónico: responder preguntas sobre productos, revisar inventario y personalizar recomendaciones antes de que un comprador dubitativo abandone el carro.

La investigación es otra área que OpenAI destaca. Experimentos que antes corrían de noche como trabajos por lotes podrían convertirse en sesiones interactivas, con equipos que prueban una idea, revisan resultados, ajustan el enfoque y lanzan otra corrida sin cortar el flujo de trabajo. En una demostración, la compañía mostró la generación de un simulador de bodega en 3D con el modo activado.

¿Cuánto cuesta cada nivel de velocidad?

OpenAI ya cobra por velocidad de inferencia de forma escalonada. A través de la API ofrece un Fast Mode que promete hasta 2,5 veces más rapidez y menor latencia para GPT-5.6 Sol, a aproximadamente el doble del precio. Ultrafast agrega un tercer escalón, más veloz y probablemente más caro, aunque la tarifa todavía no se anuncia.

NivelVelocidad relativaPrecio
StandardBaseTarifa normal de GPT-5.6 Sol
FastHasta 2,5xCerca del doble
UltrafastHasta 14x (750 tokens/s)Sin anunciar, en vista previa

La lógica replica lo que hacen proveedores de nube como AWS, que llevan años cobrando más por el mismo servicio a mayores niveles de rendimiento. OpenAI aplica ese modelo a la inferencia de IA: si la velocidad se vuelve un cuello de botella transversal a varias industrias, el esquema por niveles le entrega a la compañía una tajada directa de las ganancias que esa rapidez genera.

Qué implica para los equipos de la región

Para un desarrollador en Chile o el resto de LatAm, la variable que cambia con 750 tokens por segundo no es el costo por token sino el tipo de producto que se puede construir. A velocidad estándar, una respuesta larga de un modelo de razonamiento se siente como un trabajo en segundo plano; a este ritmo, una respuesta de 1.500 tokens sale en cerca de dos segundos y entra en el terreno de lo conversacional.

Contra eso juegan dos límites concretos: el acceso está restringido a clientes seleccionados de la API, y la latencia de red hacia los centros de datos de OpenAI se suma a cualquier ganancia de inferencia. La aceleración es del modelo, no del cable.