Gemini 3.8 Live 是什么?
Gemini 3.8 Live 是 Google 在 Live API 里的端到端语音对话模型,2026-09-15 发布。端到端语音对话是指同一个模型边听边说,不是先转写、再理解、再合成配音的串联。它管实时话轮。它不会把这次通话归档成可搜索的复盘。
截至 2026-09-16,Google 于 2026-09-15 把 Gemini 3.8 Live 与 3.8 Live Extended Thinking 放进 Live API:端到端语音对话、通话中切换 97 种语言、异步工具调用、视觉锚定。音频入 $0.005/分钟、出 $0.018/分钟。Extended Thinking 在 Artificial Analysis Speech-to-Speech 以 82.6 领先。Gemini 3.8 Flash 是文本快模型。Live 才是语音通话。
Paste a podcast, lecture, or meeting URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.
截至 2026-09-16,Google 于 2026-09-15 把 Gemini 3.8 Live 与 3.8 Live Extended Thinking 放进 Live API:端到端语音对话、97 语热切换、异步工具调用、视觉上下文。音频入 $0.005/分钟、出 $0.018/分钟。Extended Thinking 在 Artificial Analysis Speech-to-Speech 以 82.6 领先。这是实时对话产品,不是总结引擎。
公开数字来自 Google 的 Live API 公告和开发者文档——不是声称 BibiGPT 在跑这个模型。
Gemini 3.8 Live 用同一个模型同时处理输入和输出音频。对方可以打断、中途换语言,或在工具跑着时继续说话。那是实时通话,不是复盘。
Google 公布 Gemini 3.8 Live Extended Thinking 在 Artificial Analysis Speech-to-Speech 得分 82.6,高于 GPT-Live-1-Astra。音频输入每分钟 $0.005,输出每分钟 $0.018。这些分数和标价是 Google 的,这里转述。
Live 模型能理解和生成 97 种语言的语音,并可在通话中途切换。输入包括文本、图片、音频和视频。同日,Gemini 3.5 Transcribe——独立的语音转文字 SKU,覆盖 85+ 语言——进入 Gemini API。
打断更自然,不会给上周的决定打时间戳。知识工作仍需要下周二还能搜到的文件。
Gemini 3.8 Live 能在后台工具调用完成时继续说话。通话结束后,你仍需要章节、文字稿、以及能再找到的那句话。那份工作是异步的。
Laxis《State of Meetings 2026》:知识工作者每周开 21.7 场会,约占工作周 30%。更便宜的实时分钟缩不了这个堆。带时间戳的复盘可以。
Edison Infinite Dial 2026:美国听众平均每周听 8 小时 24 分钟,关注 6.8 档节目。听不完的那几档需要分诊台,不需要再一个实时语音。总结决定今天这 72 分钟给哪一档。
Google 2026-09-15 Gemini Live API 发布的关键变化。
同一个模型同时处理输入和输出音频。打断、换语言、附和留在同一会话里。先转写、再理解、再合成配音的旧做法,要等一轮说完。
Google 公布 Gemini 3.8 Live Extended Thinking 在 Artificial Analysis Speech-to-Speech 得分 82.6,总体第一,高于 GPT-Live-1-Astra。Live 本身在 Speech Agent Arena 排第二。这些是 Google 的评测,这里转述,不是我们跑的测试。
Live API 上音频输入每分钟 $0.005,输出每分钟 $0.018。GPT-Live-1 前端层每分钟 $0.05。标价是 Google 和 OpenAI 的,不是 BibiGPT SKU。
工具调用在后台跑,音频继续往外流。输入:文本、图片、音频、视频。模型能理解和生成 97 种语言的语音,并可在通话中途切换。开发者文档把 gemini-3.8-live 标为低延迟默认项。
同日,Gemini 3.5 Transcribe 进入 Gemini API:独立语音转文字,85+ 语言,流式 WER 4.0% / 非流式 2.6%(Artificial Analysis,Google 引用)。会话结束后,你仍需要下周二还能搜的章节。那是 BibiGPT 路径,不是 Live 接入。
实时语音层真正帮得上忙的地方——以及笔记流水线仍要干活的地方。
美国听众平均每周听 8 小时 24 分钟、关注 6.8 档(Edison Infinite Dial 2026)。实时语音 API 分诊不了积压。先生成章节,再决定哪一小时值得完整听。
Laxis 2026:每周 21.7 场会,约占工作周 30%。更便宜的实时分钟在通话里有用。下周二你仍需要会上定下的那句话。把录音归档,搜索文字稿。
粘贴链接。先看章节再决定播不播,跳到时间戳,导出 Markdown。Gemini 3.8 Live 不必在回路里。笔记流水线已经能在你现有的文件上跑。
笔记流水线才是产品。博客管长对比。本页管事件。
上线说法来自 Google 公告与独立报道。最后更新 2026-09-16。不是接入声明。
2026-09-15 Google 把 Gemini 3.8 Live 与 3.8 Live Extended Thinking 放进 Live API:端到端语音对话、异步函数调用、视觉上下文。音频输入每分钟 $0.005,输出每分钟 $0.018。同日 Gemini 3.5 Transcribe 进入 Gemini API(85+ 语言)。
Google — Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe (2026-09-15) ↗Gemini 3.8 Live Extended Thinking 在 Artificial Analysis Speech-to-Speech Quality Index 以 82.6 领先,τ-Voice 68.6%、Sierra τ-Voice-banking 35.1%、Big Bench Audio 97.7%。Gemini 3.8 Live 在 Speech Agent Arena 排第二。Google 数字,这里转述。
Google — Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking (2026-09-15) ↗开发者卡片:模型代码 gemini-3.8-live。输入文本、图片、音频、视频。输出文本和音频。支持 Live API。从 Gemini 3.1 Flash Live 迁移。最近更新 2026 年 9 月。
Google AI for Developers — Gemini 3.8 Live model docs ↗独立报道:97 种语言理解与生成,通话中途可切换;视觉锚定;可用「我查一下」这类口头缓冲。Extended Thinking 的 82.6 在 Artificial Analysis Speech-to-Speech 上超过 GPT-Live-1-Astra。
SiliconANGLE — Google's new speech model Gemini 3.8 Live (2026-09-15) ↗Gemini 3.5 Transcribe(2026-08-26 发布,2026-09-15 进 API):流式 WER 4.0%、非流式 WER 2.6%(Artificial Analysis,Google 引用)。85+ 语言。文件端点:说话人标签和词级时间戳。Live 端点两者都没有。截至 2026-08。
Google — Gemini 3.5 Transcribe launch (2026-08-26) ↗美国播客听众平均每周听 8 小时 24 分钟,关注 6.8 档节目。听不完的目录需要分诊台,不需要再一个实时语音。
Edison Research — The Infinite Dial 2026(截至 2026-03) ↗知识工作者每周参加 21.7 场会议,约占工作周 30%(Laxis State of Meetings 2026,截至 2026-01)。
Laxis — State of Meetings 2026 ↗Gemini 3.8 Live 是 Google 在 Live API 里的端到端语音对话模型,2026-09-15 发布。端到端语音对话是指同一个模型边听边说,不是先转写、再理解、再合成配音的串联。它管实时话轮。它不会把这次通话归档成可搜索的复盘。
看看大家为什么每天都用 BibiGPT 把视频转成文字。
全球 50,000+ 用户的信赖之选
“贴上链接几秒钟就拿到干净的字幕文字,每周帮我省下好几个小时的手动整理时间。”
Maya R.
内容创作者 · 二次创作短视频
“导出逐字稿后我可以按自己的节奏复习生词,再也不用反复暂停视频了。”
Daniel K.
语言学习者 · 用真实视频学外语
“准确、带时间戳的文字可以直接引用,它已经悄悄成为我日常工作流的一部分。”
Priya S.
研究人员 · 引用公开演讲
常见问题
有问题?问我们!
1 给 DeepSeek Harness 装视频总结 skill 只需拷贝目录——SKILL.md 和 Claude Code 通用。也可以不装 dsh:在浏览器里粘贴 B 站或 YouTube 链接,直接出带时间戳的总结。
2 2026年B站AI视频总结工具哪个最好?粘贴任意链接,几秒生成结构化总结、思维导图和重点提炼,支持30+平台、免登录。文末对比5大工具,选出最适合你的那一个。
3 海外用户如何提取B站视频字幕?2026 更新版横向对比5款主流bilibili transcript工具,从字幕提取、AI总结到格式导出全面评测,看BibiGPT如何凭借原生B站支持脱颖而出。
把播客、讲座或会议录音贴进 BibiGPT。你得到章节、可搜索文字稿和追问。Gemini 3.8 Live 处理打断。笔记仍然需要时间戳。