Gemini 3.8 Live란?
Gemini 3.8 Live는 Google Live API의 엔드투엔드 음성 대화 모델로, 2026-09-15에 출시되었습니다. 엔드투엔드 음성 대화는 하나의 모델이 들으면서 말하는 것 — 받아쓰기, 이해, 음성 합성을 직렬로 잇는 체인이 아닙니다. 실시간 턴을 담당합니다. 통화를 검색 가능한 복기로 아카이브하지는 않습니다.
2026-09-16 기준, Google이 2026-09-15에 Gemini 3.8 Live와 3.8 Live Extended Thinking을 Live API에 올렸습니다: 엔드투엔드 음성 대화, 통화 중 97개 언어 전환, 비동기 도구 호출, 시각 그라운딩. 오디오 입력 $0.005/분, 출력 $0.018/분. Extended Thinking은 Artificial Analysis Speech-to-Speech에서 82.6으로 선두입니다. Gemini 3.8 Flash는 텍스트 고속 모델입니다. Live가 음성 통화입니다.
Paste a podcast, lecture, or meeting URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.
2026-09-16 기준, Google이 2026-09-15에 Gemini 3.8 Live와 3.8 Live Extended Thinking을 Live API에 올렸습니다: 엔드투엔드 음성 대화, 97개 언어 핫스왑, 비동기 도구 호출, 시각 컨텍스트. 오디오 입력 $0.005/분, 출력 $0.018/분. Extended Thinking은 Artificial Analysis Speech-to-Speech에서 82.6으로 선두입니다. 실시간 대화 제품이지 요약 엔진이 아닙니다.
공개 숫자는 Google의 Live API 발표와 개발자 문서에서 온 것입니다 — BibiGPT가 이 모델을 돌린다는 주장이 아닙니다.
Gemini 3.8 Live는 하나의 모델로 입력·출력 오디오를 함께 처리합니다. 상대가 끼어들거나, 중간에 언어를 바꾸거나, 도구가 도는 동안에도 말을 이어 갈 수 있습니다. 그건 실시간 통화이지 복기가 아닙니다.
Google은 Gemini 3.8 Live Extended Thinking이 Artificial Analysis Speech-to-Speech에서 82.6으로 GPT-Live-1-Astra보다 앞선다고 발표했습니다. 오디오 입력은 분당 $0.005, 출력은 분당 $0.018입니다. 그 점수와 정가는 Google의 것이며, 여기서 재진술합니다.
Live 모델은 97개 언어의 음성을 이해하고 생성하며 통화 중간에 전환할 수 있습니다. 입력에는 텍스트, 이미지, 오디오, 영상이 포함됩니다. 같은 날 Gemini 3.5 Transcribe — 독립 음성-텍스트 SKU, 85+ 언어 — 가 Gemini API에 들어왔습니다.
끼어들기가 부드러워져도 지난주 결정에 타임스탬프가 찍히지는 않습니다. 지식 노동에는 다음 주 화요일에도 검색할 수 있는 파일이 여전히 필요합니다.
Gemini 3.8 Live는 백그라운드 도구 호출이 끝나는 동안에도 말을 이어 갈 수 있습니다. 통화가 끝난 뒤에도 챕터, 대본, 다시 찾을 수 있는 그 한 문장이 필요합니다. 그 일은 비동기입니다.
Laxis State of Meetings 2026: 지식 노동자는 주당 21.7회 회의에 앉고, 업무주의 약 30%입니다. 더 싼 실시간 분은 그 더미를 줄이지 않습니다. 타임스탬프 복기는 줄입니다.
Edison Infinite Dial 2026: 미국 청취자는 주당 평균 8시간 24분, 6.8개 쇼를 듣습니다. 남은 에피소드에는 분진 데스크가 필요하고, 또 하나의 실시간 음성은 필요 없습니다. 요약이 오늘 그 72분을 어디에 쓸지 정합니다.
Google 2026-09-15 Gemini Live API 출시의 헤드라인 변화.
하나의 모델이 입력·출력 오디오를 함께 처리합니다. 끼어들기, 언어 전환, 맞장구가 같은 세션에 남습니다. 받아쓰기, 이해, 음성 합성을 쌓는 방식은 한 턴이 끝나길 기다립니다.
Google은 Gemini 3.8 Live Extended Thinking이 Artificial Analysis Speech-to-Speech에서 82.6, 전체 1위, GPT-Live-1-Astra보다 앞선다고 발표했습니다. Live 자체는 Speech Agent Arena에서 2위입니다. Google 평가 수치를 재진술하며, 저희가 돌린 테스트가 아닙니다.
Live API에서 오디오 입력은 분당 $0.005, 출력은 분당 $0.018입니다. GPT-Live-1 프론트엔드 레이어는 분당 $0.05입니다. 정가는 Google과 OpenAI의 것이며 BibiGPT SKU가 아닙니다.
도구 호출은 백그라운드에서 돌고 오디오는 계속 스트리밍됩니다. 입력: 텍스트, 이미지, 오디오, 영상. 모델은 97개 언어의 음성을 이해하고 생성하며 통화 중간에 전환할 수 있습니다. 개발자 문서는 gemini-3.8-live를 저지연 기본값으로 적습니다.
같은 날 Gemini 3.5 Transcribe가 Gemini API에 들어왔습니다: 독립 음성-텍스트, 85+ 언어, 스트리밍 WER 4.0% / 비스트리밍 2.6%(Artificial Analysis, Google 인용). 세션이 끝난 뒤에는 다음 주에도 검색할 챕터가 여전히 필요합니다. 그건 BibiGPT 경로이지 Live 연동이 아닙니다.
실시간 음성 레이어가 진짜 도움이 되는 곳 — 그리고 노트 워크플로가 여전히 해야 할 일.
미국 청취자는 주당 평균 8시간 24분, 6.8개 쇼를 듣습니다(Edison Infinite Dial 2026). 실시간 음성 API는 밀린 목록을 분진하지 않습니다. 먼저 챕터를 만든 뒤, 어느 한 시간이 전체 청취 가치가 있는지 정하세요.
Laxis 2026: 주당 21.7회 회의, 업무주의 약 30%. 더 싼 실시간 분은 통화 중에 유용합니다. 다음 주 화요일에는 결정된 그 문장이 여전히 필요합니다. 녹음을 아카이브하고 대본을 검색하세요.
URL을 붙여 넣으세요. 재생 전에 챕터를 보고, 타임스탬프로 이동한 뒤 Markdown으로 내보내세요. Gemini 3.8 Live가 루프에 있을 필요는 없습니다. 노트 워크플로는 이미 보유한 파일에서 돌아갑니다.
노트 워크플로가 제품입니다. 블로그는 긴 비교. 이 페이지는 이벤트.
출시 주장은 Google 발표와 독립 보도에 근거합니다. 마지막 업데이트 2026-09-16. 연동 주장이 아닙니다.
2026-09-15 Google이 Gemini 3.8 Live와 3.8 Live Extended Thinking을 Live API에 올림: 엔드투엔드 음성 대화, 비동기 함수 호출, 시각 컨텍스트. 오디오 입력 분당 $0.005, 출력 분당 $0.018. 같은 날 Gemini 3.5 Transcribe가 Gemini API에 들어옴(85+ 언어).
Google — Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe (2026-09-15) ↗Gemini 3.8 Live Extended Thinking은 Artificial Analysis Speech-to-Speech Quality Index에서 82.6으로 선두, τ-Voice 68.6%, Sierra τ-Voice-banking 35.1%, Big Bench Audio 97.7%. Gemini 3.8 Live는 Speech Agent Arena에서 2위. Google 수치, 여기서 재진술.
Google — Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking (2026-09-15) ↗개발자 카드: 모델 코드 gemini-3.8-live. 입력 텍스트, 이미지, 오디오, 영상. 출력 텍스트와 오디오. Live API 지원. Gemini 3.1 Flash Live에서 마이그레이션. 최근 업데이트 2026년 9월.
Google AI for Developers — Gemini 3.8 Live model docs ↗독립 보도: 97개 언어 이해·생성, 통화 중 전환 가능; 시각 그라운딩; '확인해 볼게요' 같은 구두 버퍼. Extended Thinking의 82.6은 Artificial Analysis Speech-to-Speech에서 GPT-Live-1-Astra를 앞섭니다.
SiliconANGLE — Google's new speech model Gemini 3.8 Live (2026-09-15) ↗Gemini 3.5 Transcribe(2026-08-26 출시, 2026-09-15 API): 스트리밍 WER 4.0%, 비스트리밍 WER 2.6%(Artificial Analysis, Google 인용). 85+ 언어. 파일 엔드포인트: 화자 라벨과 단어 단위 타임스탬프. Live 엔드포인트: 둘 다 없음. 2026-08 기준.
Google — Gemini 3.5 Transcribe launch (2026-08-26) ↗미국 팟캐스트 청취자는 주당 평균 8시간 24분, 6.8개 쇼를 듣습니다. 남은 카탈로그에는 분진 데스크가 필요하고, 또 하나의 실시간 음성은 필요 없습니다.
Edison Research — The Infinite Dial 2026 (as of 2026-03) ↗지식 노동자는 주당 21.7회 회의에 참석하며, 업무주의 약 30%입니다(Laxis State of Meetings 2026, as of 2026-01).
Laxis — State of Meetings 2026 ↗Gemini 3.8 Live는 Google Live API의 엔드투엔드 음성 대화 모델로, 2026-09-15에 출시되었습니다. 엔드투엔드 음성 대화는 하나의 모델이 들으면서 말하는 것 — 받아쓰기, 이해, 음성 합성을 직렬로 잇는 체인이 아닙니다. 실시간 턴을 담당합니다. 통화를 검색 가능한 복기로 아카이브하지는 않습니다.
매일 영상을 텍스트로 바꾸는 데 BibiGPT가 선택받는 이유.
전 세계 50,000명 이상이 신뢰하는 서비스
“링크만 붙여넣으면 몇 초 만에 깔끔한 자막 텍스트가 나와서 매주 몇 시간씩 걸리던 받아쓰기가 사라졌어요.”
Maya R.
콘텐츠 크리에이터 · 숏폼 영상 재활용
“스크립트를 내보낼 수 있어서 영상을 계속 멈추지 않고 제 속도로 새 단어를 복습할 수 있습니다.”
Daniel K.
어학 학습자 · 실제 영상으로 공부
“타임스탬프가 달린 정확한 텍스트를 바로 인용할 수 있어요. 어느새 매일 쓰는 워크플로의 일부가 됐습니다.”
Priya S.
연구원 · 공개 강연 인용
FAQ
무엇이든 물어보세요!
1 DeepSeek Harness에 영상 요약 skill을 넣는 건 디렉터리를 복사하면 끝——SKILL.md는 Claude Code와 같습니다. dsh 없이 브라우저에 Bilibili나 YouTube 링크만 붙여도 타임스탬프 요약이 나옵니다.
2 2026년 최고의 Bilibili AI 동영상 요약 도구는? 링크를 붙여넣으면 30개 이상 플랫폼에서 구조화된 요약, 마인드맵, 핵심 포인트를 즉시 받을 수 있습니다. 상위 5개 도구를 비교합니다.
3 Bilibili 영상에서 자막을 추출하는 최고의 방법은? 5가지 주요 bilibili transcript 도구를 비교 분석하고, BibiGPT가 AI 전사, 번역, 요약 기능으로 어떻게 차별화되는지 알아보세요.
팟캐스트·강의·회의 녹음을 BibiGPT에 붙여 넣으세요. 챕터, 검색 가능한 대본, 후속 Q&A를 받습니다. Gemini 3.8 Live가 끼어들기를 처리합니다. 노트에는 여전히 타임스탬프가 필요합니다.