OpenAI abre su modelo de voz a la API a 5 céntimos el minuto y con soporte de telefonía
OpenAI ha puesto hoy GPT-Live-1 en su API: un modelo de voz full-duplex —escucha y habla a la vez, en lugar de esperar su turno— a 0,05 dólares el minuto y con soporte de telefonía.
Esas tres cosas juntas significan una sola: contestar el teléfono deja de ser un problema de personal y pasa a ser una línea de coste variable. Y no en teoría: ya hay producto en la calle.
Lo que se ha lanzado, en concreto
- Voz full-duplex: puede escuchar mientras habla, gestionar el ruido de fondo y mantener el contexto en sesiones largas.
- Soporte de telefonía para montar agentes que atiendan llamadas completas.
- Detección de turno nativa, transcripción y texto de respuesta, sesgo por palabras clave y comprensión de secuencias alfanuméricas —números de pedido, matrículas, DNI—.
- Voces personalizadas: se puede moldear tono, ritmo y estilo desde el prompt de sistema. El acceso a voces propias hay que pedirlo a ventas.
- Precio: 0,05 dólares por minuto.
El número que decide no es el benchmark: es la latencia
OpenAI publica una batería de resultados, pero el que importa en una llamada real es uno:
- 0,798 segundos de latencia al tomar el turno, frente a 1,41 s del modelo anterior (GPT-Realtime-2.1) y 1,63 s del previo.
En el teléfono, el silencio es lo que delata al robot. Segundo y medio de pausa antes de cada respuesta es exactamente la señal por la que la gente cuelga; ocho décimas ya está en el rango de una conversación torpe pero humana. Es la diferencia entre un sistema que se tolera y uno que se abandona.
Lo dice, con otro dato, uno de los clientes de lanzamiento. Andrew Hsu, cofundador y CTO de Speak, cuenta que sus evaluaciones iniciales encontraron que el modelo «reducía las interrupciones durante las pausas de pensamiento de los alumnos en casi un 80 %» frente a los sistemas por turnos.
Ya hay alguien contestando llamadas con esto
Yelp lo ha integrado en Yelp Host, su herramienta de voz con IA para restaurantes, y en un segundo producto junto a Hatch. Su director de tecnología, Alex Levy, apunta a un efecto secundario interesante:
«Los que llaman también están hablando con frases más completas y naturales, lo que nos dice que la experiencia al otro lado se siente genuinamente distinta.»
Los otros clientes citados: Fin (soporte de voz), donde su COO Jordan Neil dice que el modelo lleva la atención «de un ritmo de arranques y paradas hacia el flujo natural de una llamada de teléfono», y Cognition, que lo empareja con su agente Devin.
Los 5 céntimos, comparados bien
Aquí hace falta cuidado, porque comparar mal este precio es la forma más rápida de presupuestar una cosa creyendo que se presupuesta otra.
En agosto calculamos cuánto cuesta el minuto de voz con IA en ElevenLabs: entre 0,20 dólares en el plan de entrada y 0,165 a partir de Pro, con la tarifa prácticamente plana. Pero en esa misma pieza dejamos anotado un detalle que ahora resulta ser la clave: los «5 céntimos por minuto» que anuncia ElevenLabs en su plan Business son otra línea de producto —síntesis de voz de baja latencia—, no locución.
Es decir: los 0,05 dólares de GPT-Live-1 caen exactamente en la banda de la voz conversacional de baja latencia, no en la de la locución. Comparado con locutar un anuncio, parece tres veces más barato; comparado con lo que compite de verdad, está en precio de mercado.
Y una cautela sobre esa cifra: la cobertura describe los 0,05 dólares como el precio de la capa de voz. No está claro si incluye el coste del modelo que razona por debajo. Antes de multiplicar minutos por céntimos en una hoja de cálculo, conviene confirmarlo.
Por qué esto importa para el negocio local
Hay un cruce con un dato que publicamos hace poco y que cambia la lectura. Las llamadas al negocio local siguen cayendo aunque el ranking aguante — pero seguir cayendo no es desaparecer: para un restaurante, una clínica o un taller, la llamada sigue siendo el momento en que se cierra la reserva.
El problema nunca fue el canal, fue que nadie lo coge. Un negocio pequeño pierde llamadas en hora punta, fuera de horario y cuando hay una sola persona atendiendo. Yelp Host es literalmente eso: alguien que sí coge el teléfono, a un coste por minuto.
No hace falta creerse la promesa para ver la consecuencia: si atender llamadas se abarata un orden de magnitud, el teléfono vuelve a ser un canal que se puede trabajar en vez de uno que se aguanta.
Las cautelas, que aquí son grandes
- Ni una mención al español, a España ni a Latinoamérica. El anuncio habla de voces «en acentos, dialectos e idiomas» ampliados y de que seguirá expandiendo la disponibilidad lingüística «en los próximos meses». Para nuestro lector, ese es el dato que decide si esto se puede usar hoy, y no está.
- Todos los benchmarks son de OpenAI, sobre pruebas que la propia compañía reporta, sin verificación independiente. Los saltos que publica son grandes —del 45,7 % al 86,2 % en una de ellas— y precisamente por eso conviene tratarlos como lo que son.
- Las voces personalizadas pasan por ventas. Si tu caso depende de una voz de marca propia, esto no es autoservicio.
- Y la parte legal no la resuelve el precio. Poner una voz sintética a atender a tus clientes toca consentimiento, identificación del interlocutor y derechos: los derechos de imagen y voz en la era de la IA siguen siendo el capítulo que más caro sale saltarse.
Para el contexto de dónde viene esto: OpenAI presentó GPT-Live dentro de ChatGPT en julio con tres abuelas de protagonistas. Lo de hoy es el mismo modelo puesto a disposición de quien quiera construir con él.
El lanzamiento es del 10 de septiembre de 2026. Precio, capacidades, cifras de latencia, benchmarks y citas de clientes están tomados de la cobertura de Unite.AI y del anuncio de OpenAI, más el comunicado de Yelp distribuido por Business Wire el 9 de septiembre. La página del anuncio en openai.com nos devuelve 403, como el resto de ese dominio desde agosto, así que no hemos podido leerla directamente. Los benchmarks son evaluaciones reportadas por OpenAI sin verificación independiente. La comparación de precios con ElevenLabs y la lectura sobre el negocio local son nuestras. Foto de portada: «Wisconsin Bell Telephone Company Switchboard», vía FortepanIowa, bajo licencia CC BY-SA 4.0; es una centralita telefónica histórica y se usa de forma ilustrativa.