GPT-Live-1 explicado — Voz full-duplex, no un motor de resumen

TL;DR — Al 2026-09-15, OpenAI puso GPT-Live-1 en la API el 2026-09-10: escucha y habla a la vez, turnos de ~0.8s vs ~1.4s en GPT-Realtime-2.1, $0.05 por minuto en la capa de voz front-end. Mantiene la conversación. No archiva lo que se decidió en la reunión de la semana pasada.

Evento · 2026-09-10 Full duplex Prueba abajo

File the recap. Keep the live call.

Paste a podcast, lecture, or meeting URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.

Añade BibiGPT como fuente preferida en Google Verás más BibiGPT en Noticias destacadas y en las respuestas con IA.

Hechos clave (lectura de 90 segundos)

Al 2026-09-15, OpenAI puso GPT-Live-1 en la API el 2026-09-10: voz full-duplex, turnos de 0.798s vs 1.41s en GPT-Realtime-2.1, $0.05/min en la capa front-end. El razonamiento más profundo se delega. Es un producto de conversación en vivo, no un motor de resumen.

Features

Qué envió OpenAI el 2026-09-10

Números públicos del anuncio de API y la documentación para desarrolladores de OpenAI — no un reclamo de que BibiGPT ejecute este modelo.

Full duplex: escuchar mientras hablas

GPT-Live-1 razona sobre el audio entrante y saliente en un solo modelo. Quien llama puede interrumpir, hacer backchannel o cambiar de rumbo sin la pausa de un walkie-talkie. Eso es una llamada en vivo, no un resumen.

Turnos de ~0.8s, $0.05/min front-end

OpenAI reporta turnos de 0.798 segundos vs 1.41 segundos en GPT-Realtime-2.1. La capa de voz cuesta $0.05 por minuto, facturada por segundo. Los modelos backend y las herramientas se facturan aparte.

12 voces, solo audio y texto

Voces de lanzamiento: Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta, Cinder. Entradas y salidas son audio y texto. La entrada de imagen de la línea Realtime no está en esta ficha.

Por qué una capa de voz en vivo aún deja un hueco de notas

Una interrupción más fluida no pone marca de tiempo a la decisión de la semana pasada. El trabajo de conocimiento sigue necesitando un archivo que puedas buscar el martes que viene.

Hablar en vivo no es un archivo buscable

GPT-Live-1 mantiene la conversación mientras un backend consulta cosas. Después de la llamada, aún necesitas capítulos, una transcripción y una cita que puedas encontrar de nuevo. Ese trabajo es asíncrono.

Las reuniones ya se comen ~30% de la semana

Laxis State of Meetings 2026: los knowledge workers atraviesan 21.7 reuniones a la semana, cerca del 30% de la semana laboral. Un turno más rápido no achica ese montón. Un resumen con marcas de tiempo sí.

Los podcasts están limitados por tiempo, no por oferta

Edison Infinite Dial 2026: los oyentes de podcasts en EE. UU. promedian 8 horas 24 minutos a la semana en 6.8 shows. Los episodios que sobran necesitan un escritorio de triaje, no otra voz en vivo. Un resumen decide qué hora vale la pena reproducir.

5 cambios clave (lectura de 90 segundos)

Cambios destacados del lanzamiento de la API GPT-Live-1 de OpenAI el 2026-09-10.

  1. 1

    Full duplex en lugar de turnos

    Un solo modelo razona sobre el audio entrante y saliente a la vez. Interrupciones, pausas y backchannels quedan en la misma sesión. GPT-Realtime-2.1 esperaba a que terminara el turno.

  2. 2

    Turnos de ~0.8s, interactividad 80.1%

    OpenAI reporta turnos de 0.798s vs 1.41s en GPT-Realtime-2.1, e interactividad 80.1% en Full Duplex Bench v1.5 vs 45.4%. Esos puntajes son las evals de OpenAI, reexpresadas aquí, no una prueba que corrimos nosotros.

  3. 3

    $0.05/min front-end; backend aparte

    Las sesiones de voz cuestan $0.05 por minuto, facturadas por segundo. El razonamiento más profundo y las herramientas van a un backend que eliges y pagas aparte. El precio de lista es de OpenAI, no un SKU de BibiGPT.

  4. 4

    12 voces; solo audio y texto

    Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta, Cinder. Transcripciones ASR nativas y texto de respuesta. Sin entrada de imagen ni video en esta ficha.

  5. 5

    Delegación, no un archivo de resumen

    GPT-Live-1 puede seguir hablando mientras un backend busca un pedido o ejecuta una herramienta. Después de la sesión, aún necesitas capítulos y una transcripción que puedas buscar la semana que viene. Ese es el camino de BibiGPT, no una integración de GPT-Live-1.

3 escenarios típicos para usuarios de BibiGPT

Dónde ayuda una capa de voz en vivo — y dónde un flujo de notas sigue haciendo el trabajo.

Hosteas o editas un podcast semanal

Los oyentes en EE. UU. promedian 8 horas 24 minutos a la semana en 6.8 shows (Edison Infinite Dial 2026). Una API de voz en vivo no tria el backlog. Genera capítulos primero, luego decide qué hora vale la pena escuchar completa.

Pasas por más de 20 reuniones a la semana

Laxis 2026: 21.7 reuniones a la semana, cerca del 30% de la semana laboral. Una interrupción de 0.8 segundos sirve en la llamada. El martes que viene aún necesitas la frase que se decidió. Archiva la grabación; busca en la transcripción.

Ya tienes una grabación de clase

Pega la URL. Obtén capítulos antes de darle play, salta a una marca de tiempo, exporta Markdown. GPT-Live-1 no tiene que estar en el circuito. El flujo de notas ya corre sobre archivos que posees.

Páginas relacionadas de BibiGPT

El flujo de notas es el producto. El blog tiene el método largo. Esta página tiene el evento.

Fuentes

Las afirmaciones de lanzamiento vienen del anuncio de OpenAI y de cobertura independiente. Última actualización 2026-09-15. No es un reclamo de integración.

¿Qué es GPT-Live-1?

¿Qué es GPT-Live-1?

GPT-Live-1 es la API de voz full-duplex de OpenAI, liberada a desarrolladores el 2026-09-10. Full duplex significa que el modelo escucha y habla al mismo tiempo, como una llamada telefónica y no como un walkie-talkie. Maneja el turno en vivo. No archiva un resumen buscable de la llamada.

Preferido por creadores, estudiantes e investigadores

Por qué la gente usa BibiGPT cada día para convertir vídeos en texto.

Más de 50 000 usuarios en todo el mundo confían en nosotros

★★★★★

“Pego un enlace y obtengo subtítulos limpios en segundos: me ahorra horas de transcripción cada semana.”

Maya R.

Creadora de contenido · Reutiliza vídeos cortos

★★★★★

“Exportar la transcripción me permite repasar vocabulario a mi ritmo en lugar de pausar el vídeo constantemente.”

Daniel K.

Estudiante de idiomas · Estudia con vídeos reales

★★★★★

“Texto preciso con marcas de tiempo que puedo citar directamente. Sin darme cuenta, ya es parte de mi rutina diaria.”

Priya S.

Investigadora · Cita charlas públicas

Preguntas frecuentes

Resolvemos cualquier duda.

Popular guides

Quédate con la llamada en vivo. Archiva el resumen.

Pega un podcast, una clase o una grabación de reunión en BibiGPT. Obtienes capítulos, una transcripción buscable y Q&A de seguimiento. GPT-Live-1 maneja la interrupción. Las notas siguen necesitando una marca de tiempo.