Gemini 3.8 Live explicado — Speech-to-speech, não um motor de resumo

Resumo — Em 2026-09-16, o Google colocou Gemini 3.8 Live e 3.8 Live Extended Thinking na Live API em 2026-09-15: speech-to-speech nativo, troca de 97 idiomas no meio da chamada, tool calls assíncronos, grounding visual. Áudio entrada $0.005/min, saída $0.018/min. Extended Thinking lidera Artificial Analysis Speech-to-Speech com 82.6. Gemini 3.8 Flash é o modelo de texto. Live é a chamada de voz.

Evento · 2026-09-15 Speech-to-speech Teste abaixo

File the recap. Keep the live call.

Paste a podcast, lecture, or meeting URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.

Adicionar BibiGPT como fonte preferida no Google Veja mais BibiGPT nas Principais notícias e nas respostas com IA.

Fatos-chave (leitura de 90 segundos)

Em 2026-09-16, o Google colocou Gemini 3.8 Live e 3.8 Live Extended Thinking na Live API em 2026-09-15: speech-to-speech nativo, hot-swap de 97 idiomas, tool calls assíncronos, contexto visual. Áudio entrada $0.005/min, saída $0.018/min. Extended Thinking lidera Artificial Analysis Speech-to-Speech com 82.6. Este é um produto de conversa ao vivo, não um motor de resumo.

Features

O que o Google lançou em 2026-09-15

Números públicos do anúncio da Live API e da documentação para desenvolvedores do Google — não uma alegação de que o BibiGPT roda este modelo.

Speech-to-speech nativo, não uma cascata

O Gemini 3.8 Live raciocina sobre o áudio de entrada e de saída em um único modelo. Quem liga pode interromper, trocar de idioma no meio do turno ou continuar falando enquanto uma ferramenta roda. Isso é uma chamada ao vivo, não um resumo.

Speech-to-Speech 82.6; $0.005 / $0.018 por minuto

O Google reporta Gemini 3.8 Live Extended Thinking com 82.6 no Artificial Analysis Speech-to-Speech, à frente do GPT-Live-1-Astra. Entrada de áudio $0.005/min e saída $0.018/min. Esses scores e preços de lista são do Google, reafirmados aqui.

97 idiomas, contexto visual, Transcribe SKU dedicado

Os modelos Live entendem e geram fala em 97 idiomas e podem trocar no meio da conversa. Entradas incluem texto, imagens, áudio e vídeo. No mesmo dia, Gemini 3.5 Transcribe — um SKU separado de speech-to-text, 85+ idiomas — entrou na Gemini API.

Por que uma camada de voz ao vivo ainda deixa um buraco de notas

Uma interrupção mais fluida não coloca timestamp na decisão da semana passada. O trabalho de conhecimento ainda precisa de um arquivo que você possa buscar na próxima terça.

Falar ao vivo não é um arquivo pesquisável

O Gemini 3.8 Live pode continuar falando enquanto uma tool call termina em segundo plano. Depois da chamada, você ainda precisa de capítulos, uma transcrição e uma citação que consiga achar de novo. Esse trabalho é assíncrono.

Reuniões já comem ~30% da semana

Laxis State of Meetings 2026: knowledge workers passam por 21,7 reuniões por semana, cerca de 30% da semana de trabalho. Um minuto ao vivo mais barato não reduz essa pilha. Um resumo com timestamps reduz.

Podcasts são limitados por tempo, não por oferta

Edison Infinite Dial 2026: ouvintes de podcast nos EUA têm média de 8 horas e 24 minutos por semana em 6,8 shows. Os episódios que sobram precisam de uma mesa de triagem, não de outra voz ao vivo. Um resumo decide qual hora vale a pena ouvir.

5 mudanças-chave (leitura de 90 segundos)

Mudanças principais do lançamento da Gemini Live API do Google em 2026-09-15.

  1. 1

    Speech-to-speech nativo em vez de cascata

    Um único modelo raciocina sobre o áudio de entrada e de saída juntos. Interrupções, trocas de idioma e backchannels ficam na mesma sessão. Pilhas antigas que transcrevem, pensam e depois falam esperam o turno terminar.

  2. 2

    Extended Thinking 82.6 no Speech-to-Speech

    O Google reporta Gemini 3.8 Live Extended Thinking com 82.6 no Artificial Analysis Speech-to-Speech, #1 no geral, à frente do GPT-Live-1-Astra. O Live em si ficou em segundo no Speech Agent Arena. Esses scores são as evals do Google, reafirmadas aqui, não um teste que rodamos.

  3. 3

    $0.005/min entrada, $0.018/min saída

    Entrada de áudio é $0.005 por minuto e saída de áudio $0.018 por minuto na Live API. A camada front-end do GPT-Live-1 é $0.05/min. Os preços de lista são do Google e da OpenAI, não um SKU do BibiGPT.

  4. 4

    Ferramentas assíncronas, contexto visual, 97 idiomas

    Tool calls rodam em segundo plano enquanto o áudio continua streaming. Entradas: texto, imagens, áudio, vídeo. Os modelos entendem e geram fala em 97 idiomas e podem trocar no meio da conversa. A documentação de desenvolvedores lista gemini-3.8-live como o padrão de baixa latência.

  5. 5

    Uma camada ao vivo, mais um Transcribe SKU separado

    No mesmo dia, Gemini 3.5 Transcribe entrou na Gemini API: speech-to-text dedicado, 85+ idiomas, WER streaming 4.0% / não streaming 2.6% (Artificial Analysis, citado pelo Google). Depois da sessão você ainda precisa de capítulos que consiga buscar na semana que vem. Esse é o caminho do BibiGPT, não uma integração Live.

3 cenários típicos para usuários do BibiGPT

Onde uma camada de voz ao vivo ajuda — e onde um fluxo de notas ainda faz o trabalho.

Você apresenta ou edita um podcast semanal

Ouvintes nos EUA têm média de 8 horas e 24 minutos por semana em 6,8 shows (Edison Infinite Dial 2026). Uma API de voz ao vivo não faz a triagem do backlog. Gere capítulos primeiro, depois decida qual hora vale a pena ouvir completa.

Você passa por mais de 20 reuniões por semana

Laxis 2026: 21,7 reuniões por semana, cerca de 30% da semana de trabalho. Um minuto ao vivo mais barato é útil na chamada. Na próxima terça você ainda precisa da frase que foi decidida. Arquive a gravação; busque na transcrição.

Você já tem uma gravação de aula

Cole a URL. Pegue capítulos antes de dar play, pule para um timestamp, exporte Markdown. O Gemini 3.8 Live não precisa estar no circuito. O fluxo de notas já roda nos arquivos que você tem.

Páginas relacionadas do BibiGPT

O fluxo de notas é o produto. O blog tem a comparação longa. Esta página tem o evento.

Fontes

As alegações de lançamento vêm do anúncio do Google e de cobertura independente. Última atualização 2026-09-16. Não é uma alegação de integração.

O que é o Gemini 3.8 Live?

O que é o Gemini 3.8 Live?

O Gemini 3.8 Live é o modelo speech-to-speech nativo do Google na Live API, lançado em 2026-09-15. Speech-to-speech significa um único modelo que ouve e fala, não uma cadeia que transcreve, depois pensa e depois sintetiza fala. Ele cuida do turno ao vivo. Não arquiva um resumo pesquisável da chamada.

Adorado por criadores, estudantes e pesquisadores

Por que as pessoas usam o BibiGPT todos os dias para transformar vídeos em texto.

Mais de 50.000 usuários no mundo todo confiam

★★★★★

“Colo um link e recebo legendas limpas em segundos — economizo horas de redigitação toda semana.”

Maya R.

Criadora de conteúdo · Reaproveita vídeos curtos

★★★★★

“Exportar a transcrição me deixa revisar palavras novas no meu ritmo, sem pausar o vídeo o tempo todo.”

Daniel K.

Estudante de idiomas · Estuda com vídeos reais

★★★★★

“Texto preciso e com marcação de tempo que posso citar diretamente. Sem perceber, virou parte do meu fluxo diário.”

Priya S.

Pesquisadora · Cita palestras públicas

Perguntas frequentes

Tire qualquer dúvida.

Popular guides

Fique com a chamada ao vivo. Arquive o resumo.

Cole um podcast, uma aula ou uma gravação de reunião no BibiGPT. Você recebe capítulos, uma transcrição pesquisável e Q&A de acompanhamento. O Gemini 3.8 Live cuida da interrupção. As notas ainda precisam de um timestamp.