Skip to content

OpenAI lanza Ultrafast: GPT-5.6 Sol alcanza hasta 750 tokens por segundo

OpenAI presentó Ultrafast, un nuevo modo para GPT-5.6 Sol que promete ejecutar el modelo hasta 14 veces más rápido. La tecnología debuta en la API y apunta a aplicaciones donde cada segundo de latencia importa.

Claves del artículo

  • GPT-5.6 Sol puede generar hasta 750 tokens de salida por segundo.
  • Ultrafast alcanza una velocidad de hasta 14 veces la del procesamiento Standard.
  • La infraestructura está impulsada por Cerebras.
  • Por ahora, el servicio está disponible en preview limitado para clientes seleccionados.

OpenAI presentó el 13 de agosto Ultrafast, una nueva modalidad de procesamiento para GPT-5.6 Sol diseñada para llevar modelos avanzados a aplicaciones que necesitan respuestas prácticamente en tiempo real.

Según la compañía, Ultrafast puede alcanzar hasta 750 tokens de salida por segundo, lo que representa una velocidad de hasta 14 veces respecto del procesamiento Standard. La infraestructura detrás del servicio está desarrollada junto con Cerebras, compañía especializada en hardware para inteligencia artificial.

Menos latencia sin recurrir a modelos más pequeños

Hasta ahora, reducir drásticamente los tiempos de respuesta solía implicar utilizar modelos más pequeños o especializados. Con Ultrafast, OpenAI busca cambiar esa ecuación: mantener las capacidades de un modelo de frontera y, al mismo tiempo, aumentar significativamente su velocidad.

Entre los casos de uso señalados aparecen el análisis de incidentes informáticos, investigación financiera, detección de fraude, asistentes de voz, atención al cliente, comercio electrónico e investigación interactiva.

La velocidad también empieza a convertirse en una característica competitiva dentro del mercado de IA. Algo similar ocurrió con las mejoras recientes en generación visual: OpenAI ya había acelerado considerablemente ChatGPT Images, reduciendo los tiempos necesarios para crear y modificar imágenes.

Una nueva variable para los productos con IA

Ultrafast todavía está disponible únicamente para un grupo seleccionado de clientes, y OpenAI prevé ampliar el acceso a medida que aumente la capacidad del servicio.

Más allá de la cifra de tokens por segundo, el lanzamiento muestra un cambio relevante: la velocidad de inferencia empieza a determinar qué experiencias pueden construirse con los modelos más avanzados. Si estas prestaciones se extienden a mayor escala, aplicaciones que hoy funcionan mediante procesos de varios pasos podrían transformarse en experiencias mucho más cercanas a una interacción instantánea.