Gemini 3.8 Live: разбор — speech-to-speech, не движок саммари

Кратко — По состоянию на 2026-09-16 Google 2026-09-15 поместила Gemini 3.8 Live и 3.8 Live Extended Thinking в Live API: native speech-to-speech, смена 97 языков посреди звонка, async tool calls, visual grounding. Аудио вход $0.005/мин, выход $0.018/мин. Extended Thinking лидирует Artificial Analysis Speech-to-Speech с 82.6. Gemini 3.8 Flash — текстовая модель. Live — голосовой звонок.

Событие · 2026-09-15 Speech-to-speech Демо ниже

File the recap. Keep the live call.

Paste a podcast, lecture, or meeting URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.

Добавьте BibiGPT в предпочитаемые источники Google Больше материалов BibiGPT в «Главных новостях» и ответах ИИ.

Ключевые факты (чтение за 90 секунд)

По состоянию на 2026-09-16 Google 2026-09-15 поместила Gemini 3.8 Live и 3.8 Live Extended Thinking в Live API: native speech-to-speech, hot-swap 97 языков, async tool calls, визуальный контекст. Аудио вход $0.005/мин, выход $0.018/мин. Extended Thinking лидирует Artificial Analysis Speech-to-Speech с 82.6. Это продукт живого разговора, а не движок саммари.

Features

Что Google реально выпустила 2026-09-15

Публичные цифры из анонса Live API и документации для разработчиков Google — не утверждение, что BibiGPT крутит эту модель.

Native speech-to-speech, не каскад

Gemini 3.8 Live рассуждает над входящим и исходящим аудио в одной модели. Собеседник может перебивать, менять язык посреди хода или продолжать говорить, пока работает инструмент. Это живой звонок, а не саммари.

Speech-to-Speech 82.6; $0.005 / $0.018 за минуту

Google сообщает Gemini 3.8 Live Extended Thinking 82.6 на Artificial Analysis Speech-to-Speech, впереди GPT-Live-1-Astra. Вход аудио $0.005/мин, выход $0.018/мин. Эти scores и прайс — Google, пересказанные здесь.

97 языков, визуальный контекст, отдельный Transcribe SKU

Live-модели понимают и генерируют речь на 97 языках и могут переключаться посреди разговора. Входы: текст, изображения, аудио и видео. В тот же день Gemini 3.5 Transcribe — отдельный speech-to-text SKU, 85+ языков — появился в Gemini API.

Почему живой голосовой слой всё равно оставляет дыру в заметках

Более плавное прерывание не ставит таймстемп на решение прошлой недели. Knowledge work по-прежнему нужен файл, который вы найдёте во вторник.

Живой разговор — не поисковый архив

Gemini 3.8 Live может продолжать говорить, пока tool call заканчивается в фоне. После звонка вам всё равно нужны главы, транскрипт и цитата, которую можно найти снова. Эта работа асинхронная.

Встречи уже съедают ~30% недели

Laxis State of Meetings 2026: knowledge workers проводят 21,7 встреч в неделю — около 30% рабочей недели. Более дешёвая живая минута эту кучу не уменьшит. Саммари с таймстемпами уменьшит.

Подкасты ограничены временем, а не предложением

Edison Infinite Dial 2026: слушатели подкастов в США в среднем 8 часов 24 минуты в неделю на 6,8 шоу. Оставшиеся эпизоды нуждаются в столе сортировки, а не в ещё одном живом голосе. Саммари решает, какой час стоит слушать.

5 ключевых изменений (чтение за 90 секунд)

Главные сдвиги запуска Gemini Live API от Google 2026-09-15.

  1. 1

    Native speech-to-speech вместо каскада

    Одна модель рассуждает над входящим и исходящим аудио вместе. Прерывания, смена языка и backchannel остаются в одной сессии. Старые связки «расшифровать → понять → озвучить» ждут конца хода.

  2. 2

    Extended Thinking 82.6 на Speech-to-Speech

    Google сообщает Gemini 3.8 Live Extended Thinking 82.6 на Artificial Analysis Speech-to-Speech, #1 overall, впереди GPT-Live-1-Astra. Live сам занял второе место на Speech Agent Arena. Это evals Google, пересказанные здесь, а не наш тест.

  3. 3

    $0.005/мин вход, $0.018/мин выход

    Вход аудио — $0.005 за минуту, выход аудио — $0.018 за минуту на Live API. Front-end слой GPT-Live-1 — $0.05/мин. Прайс — Google и OpenAI, не SKU BibiGPT.

  4. 4

    Async-инструменты, визуальный контекст, 97 языков

    Tool calls идут в фоне, пока аудио продолжает стримиться. Входы: текст, изображения, аудио, видео. Модели понимают и генерируют речь на 97 языках и могут переключаться посреди разговора. Документация для разработчиков указывает gemini-3.8-live как low-latency default.

  5. 5

    Живой слой плюс отдельный Transcribe SKU

    В тот же день Gemini 3.5 Transcribe появился в Gemini API: выделенный speech-to-text, 85+ языков, streaming WER 4.0% / non-streaming 2.6% (Artificial Analysis, цитирует Google). После сессии вам всё равно нужны главы, которые вы найдёте на следующей неделе. Это путь BibiGPT, а не интеграция Live.

3 типичных сценария для пользователей BibiGPT

Где живой голосовой слой помогает — и где пайплайн заметок всё равно делает работу.

Вы ведёте или монтируете еженедельный подкаст

Слушатели в США в среднем 8 часов 24 минуты в неделю на 6,8 шоу (Edison Infinite Dial 2026). Живой голосовой API не разберёт бэклог. Сначала сгенерируйте главы, потом решите, какой час стоит дослушать.

У вас 20+ встреч в неделю

Laxis 2026: 21,7 встреч в неделю, около 30% рабочей недели. Более дешёвая живая минута полезна на звонке. Во вторник вам всё равно нужна фраза, которую решили. Заархивируйте запись; ищите в транскрипте.

У вас уже есть запись лекции

Вставьте URL. Получите главы до play, прыгните к таймстемпу, экспортируйте Markdown. Gemini 3.8 Live не обязан быть в контуре. Пайплайн заметок уже работает на ваших файлах.

Связанные страницы BibiGPT

Пайплайн заметок — это продукт. Блог держит длинное сравнение. Эта страница держит событие.

Источники

Утверждения о запуске — из анонса Google и независимых обзоров. Обновлено 2026-09-16. Не утверждение об интеграции.

  • 2026-09-15 Google поместила Gemini 3.8 Live и 3.8 Live Extended Thinking в Live API: native speech-to-speech, async function calling, визуальный контекст. Вход аудио $0.005/мин, выход аудио $0.018/мин. В тот же день Gemini 3.5 Transcribe появился в Gemini API (85+ языков).

    Google — Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe (2026-09-15) ↗
  • Gemini 3.8 Live Extended Thinking лидирует Artificial Analysis Speech-to-Speech Quality Index с 82.6: 68.6% на τ-Voice, 35.1% на Sierra τ-Voice-banking, 97.7% на Big Bench Audio. Gemini 3.8 Live занял второе место на Speech Agent Arena. Цифры Google, пересказанные.

    Google — Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking (2026-09-15) ↗
  • Карточка разработчика: код модели gemini-3.8-live. Входы текст, изображения, аудио, видео. Выходы текст и аудио. Live API поддерживается. Миграция с Gemini 3.1 Flash Live. Последнее обновление сентябрь 2026.

    Google AI for Developers — Gemini 3.8 Live model docs ↗
  • Независимый обзор: понимание и генерация на 97 языках со сменой посреди разговора; visual grounding; ранние вербальные cues вроде «сейчас проверю». Extended Thinking 82.6 обходит GPT-Live-1-Astra на Artificial Analysis Speech-to-Speech.

    SiliconANGLE — Google's new speech model Gemini 3.8 Live (2026-09-15) ↗
  • Gemini 3.5 Transcribe (2026-08-26, API 2026-09-15): streaming WER 4.0%, non-streaming WER 2.6% (Artificial Analysis, цитирует Google). 85+ языков. File endpoint: метки спикеров и word-level timestamps. Live endpoint: ни того ни другого. По состоянию на 2026-08.

    Google — Gemini 3.5 Transcribe launch (2026-08-26) ↗
  • Слушатели подкастов в США в среднем 8 часов 24 минуты в неделю и следят за 6,8 шоу. Оставшийся каталог нуждается в столе сортировки, а не в ещё одном живом голосе.

    Edison Research — The Infinite Dial 2026 (по состоянию на 2026-03) ↗
  • Knowledge workers посещают 21,7 встреч в неделю — около 30% рабочей недели (Laxis State of Meetings 2026, по состоянию на 2026-01).

    Laxis — State of Meetings 2026 ↗

Что такое Gemini 3.8 Live?

Что такое Gemini 3.8 Live?

Gemini 3.8 Live — native speech-to-speech модель Google в Live API, выпущенная 2026-09-15. Speech-to-speech значит, что одна модель слушает и говорит, а не цепочка «сначала расшифровать, потом понять, потом озвучить». Она ведёт живой ход. Она не архивирует поисковое саммари звонка.

Нравится авторам, студентам и исследователям

Почему люди каждый день используют BibiGPT, чтобы превращать видео в текст.

Нам доверяют более 50 000 пользователей по всему миру

★★★★★

“Вставляю ссылку — и через несколько секунд получаю чистые субтитры. Каждую неделю это экономит мне часы перепечатки.”

Maya R.

Контент-мейкер · Переупаковывает короткие видео

★★★★★

“Экспорт расшифровки позволяет повторять новые слова в своём темпе, не останавливая видео каждую минуту.”

Daniel K.

Изучает языки · Учится по реальным видео

★★★★★

“Точный текст с таймкодами, который можно цитировать напрямую. Незаметно стал частью моей ежедневной работы.”

Priya S.

Исследователь · Цитирует публичные выступления

Часто задаваемые вопросы

Спрашивайте что угодно.

Popular guides

Оставьте живой звонок. Заархивируйте саммари.

Вставьте подкаст, лекцию или запись встречи в BibiGPT. Вы получите главы, поисковый транскрипт и Q&A. Gemini 3.8 Live обрабатывает прерывание. Заметкам по-прежнему нужен таймстемп.