Gemini 3.8 Live とは?
Gemini 3.8 Live は Google の Live API におけるエンドツーエンド音声対話モデルで、2026-09-15 に公開されました。エンドツーエンド音声対話とは、同一モデルが聞いて話すこと——書き起こし、理解、音声合成を直列にした連鎖ではありません。ライブのターンを扱います。通話を検索可能なレビューとしてアーカイブはしません。
2026-09-16 時点、Google は 2026-09-15 に Gemini 3.8 Live と 3.8 Live Extended Thinking を Live API に投入:エンドツーエンド音声対話、通話中に 97 言語切替、非同期ツール呼び出し、視覚グラウンディング。音声入力 $0.005/分、出力 $0.018/分。Extended Thinking は Artificial Analysis Speech-to-Speech で 82.6 と首位。Gemini 3.8 Flash はテキスト向け高速モデル。Live が音声通話です。
Paste a podcast, lecture, or meeting URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.
2026-09-16 時点、Google は 2026-09-15 に Gemini 3.8 Live と 3.8 Live Extended Thinking を Live API に投入:エンドツーエンド音声対話、97 言語ホットスワップ、非同期ツール呼び出し、視覚コンテキスト。音声入力 $0.005/分、出力 $0.018/分。Extended Thinking は Artificial Analysis Speech-to-Speech で 82.6 と首位。リアルタイム対話製品であり、要約エンジンではありません。
公開数字は Google の Live API 発表と開発者ドキュメント由来です——BibiGPT がこのモデルを動かしているという主張ではありません。
Gemini 3.8 Live は同一モデルで入力と出力の音声を同時に処理します。相手は割り込み、途中で言語切替、ツール実行中も話し続けられます。それはライブ通話であり、レビューではありません。
Google は Gemini 3.8 Live Extended Thinking が Artificial Analysis Speech-to-Speech で 82.6、GPT-Live-1-Astra を上回ると報告しています。音声入力は 1 分 $0.005、出力は 1 分 $0.018。これらのスコアとリスト価格は Google のものであり、ここで再掲します。
Live モデルは 97 言語の音声を理解・生成でき、通話中に切替可能です。入力はテキスト、画像、音声、動画。同日、Gemini 3.5 Transcribe——独立の音声テキスト化 SKU、85+ 言語——が Gemini API に入りました。
割り込みが自然になっても、先週の決定にタイムスタンプは付きません。ナレッジワークには、来週火曜にも検索できるファイルがなお必要です。
Gemini 3.8 Live はバックグラウンドのツール呼び出しが終わるあいだも話し続けられます。通話のあと、なお章立て、文字起こし、もう一度見つけられる一文が必要です。その仕事は非同期です。
Laxis《State of Meetings 2026》:ナレッジワーカーは週 21.7 回の会議に出ており、勤務週の約 30% です。安いライブ分ではこの山は縮みません。タイムスタンプ付きレビューなら縮みます。
Edison Infinite Dial 2026:米国リスナーは平均週 8 hours 24 minutes、フォロー番組は 6.8。聞ききれない分にはトリアージ台が必要で、もう一つのライブ音声ではありません。要約が、今日の 72 分をどの番組に使うかを決めます。
Google の 2026-09-15 Gemini Live API ローンチからの主要変化。
同一モデルが入力と出力の音声を同時に処理します。割り込み、言語切替、相づちは同じセッションに残ります。書き起こし、理解、音声合成を積み上げる方式はターン終了を待ちます。
Google は Gemini 3.8 Live Extended Thinking が Artificial Analysis Speech-to-Speech で 82.6、全体 1 位、GPT-Live-1-Astra を上回ると報告しています。Live 自体は Speech Agent Arena で 2 位。これらは Google の評価であり、ここで再掲するもので、私たちが走らせたテストではありません。
Live API 上の音声入力は 1 分 $0.005、出力は 1 分 $0.018。GPT-Live-1 のフロントエンド層は 1 分 $0.05。リスト価格は Google と OpenAI のものであり、BibiGPT の SKU ではありません。
ツール呼び出しはバックグラウンドで走り、音声はストリームし続けます。入力:テキスト、画像、音声、動画。モデルは 97 言語の音声を理解・生成でき、通話中に切替可能です。開発者ドキュメントは gemini-3.8-live を低レイテンシのデフォルトとして挙げています。
同日、Gemini 3.5 Transcribe が Gemini API に投入:独立の音声テキスト化、85+ 言語、ストリーミング WER 4.0% / 非ストリーミング 2.6%(Artificial Analysis、Google 引用)。セッションのあと、なお来週にも検索できる章立てが必要です。それは BibiGPT の道であり、Live 連携ではありません。
ライブ音声レイヤーが本当に役立つところ——そしてノートワークフローがなお仕事をするところ。
米国リスナーは平均週 8 hours 24 minutes、フォロー番組は 6.8(Edison Infinite Dial 2026)。ライブ音声 API はバックログをトリアージしません。先に章立てを生成し、どの 1 時間がフル再生に値するかを決めてください。
Laxis 2026:週 21.7 回の会議、勤務週の約 30%。安いライブ分は通話中に役立ちます。来週火曜にはなお、決まった一文が必要です。録音をアーカイブし、文字起こしを検索してください。
URL を貼ってください。再生前に章立てを読み、タイムスタンプへ飛び、Markdown をエクスポートします。Gemini 3.8 Live はループに入る必要がありません。ノートワークフローは、すでに手元のファイル上で回せます。
ノートワークフローが製品です。ブログが長い比較を持ち、本ページがイベントを持ちます。
ローンチの記述は Google の発表と独立報道に基づきます。最終更新 2026-09-16。連携宣言ではありません。
2026-09-15、Google は Gemini 3.8 Live と 3.8 Live Extended Thinking を Live API に投入:エンドツーエンド音声対話、非同期関数呼び出し、視覚コンテキスト。音声入力 1 分 $0.005、出力 1 分 $0.018。同日 Gemini 3.5 Transcribe が Gemini API に投入(85+ 言語)。
Google — Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe (2026-09-15) ↗Gemini 3.8 Live Extended Thinking は Artificial Analysis Speech-to-Speech Quality Index で 82.6 と首位、τ-Voice 68.6%、Sierra τ-Voice-banking 35.1%、Big Bench Audio 97.7%。Gemini 3.8 Live は Speech Agent Arena で 2 位。Google の数字であり、ここで再掲。
Google — Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking (2026-09-15) ↗開発者カード:モデルコード gemini-3.8-live。入力はテキスト、画像、音声、動画。出力はテキストと音声。Live API 対応。Gemini 3.1 Flash Live からの移行。最新更新 2026 年 9 月。
Google AI for Developers — Gemini 3.8 Live model docs ↗独立報道:97 言語の理解と生成、通話中切替可;視覚グラウンディング;「確認します」などの口頭バッファ。Extended Thinking の 82.6 は Artificial Analysis Speech-to-Speech で GPT-Live-1-Astra を上回る。
SiliconANGLE — Google's new speech model Gemini 3.8 Live (2026-09-15) ↗Gemini 3.5 Transcribe(2026-08-26 公開、2026-09-15 API 投入):ストリーミング WER 4.0%、非ストリーミング WER 2.6%(Artificial Analysis、Google 引用)。85+ 言語。ファイルエンドポイント:話者ラベルと単語レベルタイムスタンプ。Live エンドポイント:どちらもなし。2026-08 時点。
Google — Gemini 3.5 Transcribe launch (2026-08-26) ↗米国ポッドキャストリスナーは平均週 8 hours 24 minutes 聞き、6.8 番組をフォロー。聞ききれないカタログにはトリアージ台が必要で、もう一つのライブ音声ではありません。
Edison Research — The Infinite Dial 2026(2026-03 時点) ↗ナレッジワーカーは週 21.7 回の会議に出席し、勤務週の約 30%(Laxis State of Meetings 2026、2026-01 時点)。
Laxis — State of Meetings 2026 ↗Gemini 3.8 Live は Google の Live API におけるエンドツーエンド音声対話モデルで、2026-09-15 に公開されました。エンドツーエンド音声対話とは、同一モデルが聞いて話すこと——書き起こし、理解、音声合成を直列にした連鎖ではありません。ライブのターンを扱います。通話を検索可能なレビューとしてアーカイブはしません。
動画をテキスト化するために、毎日 BibiGPT が選ばれている理由。
全世界 50,000 人以上のユーザーが利用中
“リンクを貼るだけで数秒でクリーンな字幕テキストが手に入り、毎週何時間もの書き起こし作業が不要になりました。”
Maya R.
コンテンツクリエイター · ショート動画を再編集
“文字起こしをエクスポートできるので、動画を何度も止めずに自分のペースで新しい単語を復習できます。”
Daniel K.
語学学習者 · 生の動画で学習
“タイムスタンプ付きの正確なテキストをそのまま引用できます。いつの間にか毎日のワークフローの一部になりました。”
Priya S.
研究者 · 公開講演を引用
よくある質問
ご質問はありますか?お気軽にどうぞ!
1 DeepSeek Harnessに動画要約skillを入れるのはディレクトリをコピーするだけ——SKILL.mdはClaude Codeと同じ。dshを入れなくても、ブラウザにBilibiliやYouTubeのリンクを貼ればタイムスタンプ付きの要約が出ます。
2 2026年に最適なBilibili AI動画要約ツールは?リンクを貼るだけで、30以上のプラットフォームに対応した構造化要約・マインドマップ・要点を即座に取得。上位5ツールを比較します。
3 Bilibili動画から字幕を抽出する最適な方法とは?5つの主要bilibili transcriptツールを比較分析し、BibiGPTがAI文字起こし・翻訳・要約機能でどう差別化されるかを解説します。
ポッドキャスト、講義、会議の録音を BibiGPT に貼ってください。章立て、検索可能な文字起こし、追質問が得られます。Gemini 3.8 Live が割り込みを処理します。ノートにはなおタイムスタンプが必要です。