Gemini 3.8 Live explicado — Speech-to-Speech, no un motor de resumen

TL;DR — Al 2026-09-16, Google puso Gemini 3.8 Live y 3.8 Live Extended Thinking en la Live API el 2026-09-15: Speech-to-Speech nativo, cambio de idioma a mitad de llamada en 97 idiomas, llamadas a tools async, anclaje visual. Audio de entrada $0.005/min, de salida $0.018/min. Extended Thinking lidera Artificial Analysis Speech-to-Speech con 82.6. Gemini 3.8 Flash es el modelo de texto rápido. Live es la llamada de voz.

Evento · 2026-09-15 Speech-to-speech Prueba abajo

File the recap. Keep the live call.

Paste a podcast, lecture, or meeting URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.

Añade BibiGPT como fuente preferida en Google Verás más BibiGPT en Noticias destacadas y en las respuestas con IA.

Hechos clave (lectura de 90 segundos)

Al 2026-09-16, Google puso Gemini 3.8 Live y 3.8 Live Extended Thinking en la Live API el 2026-09-15: Speech-to-Speech nativo, cambio en caliente de 97 idiomas, llamadas a tools async, contexto visual. Audio de entrada $0.005/min, de salida $0.018/min. Extended Thinking lidera Artificial Analysis Speech-to-Speech con 82.6. Es un producto de conversación en vivo, no un motor de resumen.

Features

Qué envió Google el 2026-09-15

Números públicos del anuncio de la Live API y la documentación para desarrolladores de Google — no un reclamo de que BibiGPT ejecute este modelo.

Speech-to-Speech nativo, no una cascada

Gemini 3.8 Live razona sobre el audio entrante y saliente en un solo modelo. Quien llama puede interrumpir, cambiar de idioma a mitad del turno o seguir hablando mientras corre una tool. Eso es una llamada en vivo, no un resumen.

Speech-to-Speech 82.6; $0.005 / $0.018 por minuto

Google reporta Gemini 3.8 Live Extended Thinking en 82.6 en Artificial Analysis Speech-to-Speech, por delante de GPT-Live-1-Astra. El audio de entrada cuesta $0.005/min y el de salida $0.018/min. Esos puntajes y precios de lista son de Google, reexpresados aquí.

97 idiomas, contexto visual, SKU Transcribe dedicado

Los modelos Live entienden y generan habla en 97 idiomas y pueden cambiar a mitad de conversación. Las entradas incluyen texto, imágenes, audio y video. El mismo día, Gemini 3.5 Transcribe — un SKU de speech-to-text aparte, 85+ idiomas — llegó a la Gemini API.

Por qué una capa de voz en vivo aún deja un hueco de notas

Una interrupción más suave no pone marca de tiempo a la decisión de la semana pasada. El trabajo de conocimiento sigue necesitando un archivo que puedas buscar el martes que viene.

Hablar en vivo no es un archivo buscable

Gemini 3.8 Live puede seguir hablando mientras una llamada a tool termina en segundo plano. Después de la llamada, aún necesitas capítulos, una transcripción y una cita que puedas encontrar otra vez. Ese trabajo es async.

Las reuniones ya se comen ~30% de la semana

Laxis State of Meetings 2026: los knowledge workers pasan por 21.7 reuniones a la semana, cerca del 30% de la semana laboral. Un minuto en vivo más barato no achica ese montón. Un resumen con marca de tiempo sí.

Los podcasts están atados al tiempo, no a la oferta

Edison Infinite Dial 2026: los oyentes de podcasts en EE. UU. promedian 8 horas 24 minutos a la semana en 6.8 shows. Los episodios que sobran necesitan un escritorio de triaje, no otra voz en vivo. Un resumen decide qué hora vale la pena escuchar.

5 cambios clave (lectura de 90 segundos)

Cambios destacados del lanzamiento de la Gemini Live API de Google el 2026-09-15.

  1. 1

    Speech-to-Speech nativo en lugar de una cascada

    Un solo modelo razona sobre el audio entrante y saliente a la vez. Interrupciones, cambios de idioma y backchannels quedan en la misma sesión. Las cadenas antiguas que transcriben, piensan y luego hablan esperan a que termine el turno.

  2. 2

    Extended Thinking 82.6 en Speech-to-Speech

    Google reporta Gemini 3.8 Live Extended Thinking en 82.6 en Artificial Analysis Speech-to-Speech, #1 en general, por delante de GPT-Live-1-Astra. Live mismo quedó segundo en Speech Agent Arena. Esos puntajes son las evals de Google, reexpresadas aquí, no una prueba que corrimos nosotros.

  3. 3

    $0.005/min de entrada, $0.018/min de salida

    La entrada de audio cuesta $0.005 por minuto y la salida $0.018 por minuto en la Live API. La capa front-end de GPT-Live-1 es $0.05/min. Los precios de lista son de Google y OpenAI, no un SKU de BibiGPT.

  4. 4

    Tools async, contexto visual, 97 idiomas

    Las llamadas a tools corren en segundo plano mientras el audio sigue en streaming. Entradas: texto, imágenes, audio, video. Los modelos entienden y generan habla en 97 idiomas y pueden cambiar a mitad de conversación. La documentación para desarrolladores lista gemini-3.8-live como el default de baja latencia.

  5. 5

    Una capa en vivo, más un SKU Transcribe aparte

    El mismo día, Gemini 3.5 Transcribe llegó a la Gemini API: speech-to-text dedicado, 85+ idiomas, streaming WER 4.0% / non-streaming 2.6% (Artificial Analysis, citado por Google). Después de la sesión aún necesitas capítulos que puedas buscar la semana que viene. Ese es el camino de BibiGPT, no una integración de Live.

3 escenarios típicos para usuarios de BibiGPT

Dónde ayuda una capa de voz en vivo — y dónde un flujo de notas sigue haciendo el trabajo.

Hosteas o editas un podcast semanal

Los oyentes en EE. UU. promedian 8 horas 24 minutos a la semana en 6.8 shows (Edison Infinite Dial 2026). Una API de voz en vivo no tria el backlog. Genera capítulos primero, luego decide qué hora vale la pena escuchar completa.

Pasas por más de 20 reuniones a la semana

Laxis 2026: 21.7 reuniones a la semana, cerca del 30% de la semana laboral. Un minuto en vivo más barato sirve en la llamada. El martes que viene aún necesitas la frase que se decidió. Archiva la grabación; busca en la transcripción.

Ya tienes una grabación de clase

Pega la URL. Obtén capítulos antes de darle play, salta a una marca de tiempo, exporta Markdown. Gemini 3.8 Live no tiene que estar en el circuito. El flujo de notas ya corre sobre archivos que posees.

Páginas relacionadas de BibiGPT

El flujo de notas es el producto. El blog tiene la comparación larga. Esta página tiene el evento.

Fuentes

Las afirmaciones de lanzamiento vienen del anuncio de Google y de cobertura independiente. Última actualización 2026-09-16. No es un reclamo de integración.

¿Qué es Gemini 3.8 Live?

¿Qué es Gemini 3.8 Live?

Gemini 3.8 Live es el modelo Speech-to-Speech nativo de Google en la Live API, lanzado el 2026-09-15. Speech-to-Speech significa que un solo modelo escucha y habla, no una cadena que transcribe, luego piensa y luego sintetiza voz. Maneja el turno en vivo. No archiva un resumen buscable de la llamada.

Preferido por creadores, estudiantes e investigadores

Por qué la gente usa BibiGPT cada día para convertir vídeos en texto.

Más de 50 000 usuarios en todo el mundo confían en nosotros

★★★★★

“Pego un enlace y obtengo subtítulos limpios en segundos: me ahorra horas de transcripción cada semana.”

Maya R.

Creadora de contenido · Reutiliza vídeos cortos

★★★★★

“Exportar la transcripción me permite repasar vocabulario a mi ritmo en lugar de pausar el vídeo constantemente.”

Daniel K.

Estudiante de idiomas · Estudia con vídeos reales

★★★★★

“Texto preciso con marcas de tiempo que puedo citar directamente. Sin darme cuenta, ya es parte de mi rutina diaria.”

Priya S.

Investigadora · Cita charlas públicas

Preguntas frecuentes

Resolvemos cualquier duda.

Popular guides

Quédate con la llamada en vivo. Archiva el resumen.

Pega un podcast, una clase o una grabación de reunión en BibiGPT. Obtienes capítulos, una transcripción buscable y Q&A de seguimiento. Gemini 3.8 Live maneja la interrupción. Las notas siguen necesitando una marca de tiempo.