Gemini 3.8 Live giải thích — Speech-to-Speech, không phải engine tổng kết

Tính đến 2026-09-16, Google đưa Gemini 3.8 Live và 3.8 Live Extended Thinking vào Live API ngày 2026-09-15: Speech-to-Speech gốc, đổi ngôn ngữ giữa cuộc gọi với 97 ngôn ngữ, gọi công cụ bất đồng bộ, neo hình ảnh. Audio vào $0.005/phút, ra $0.018/phút. Extended Thinking dẫn Artificial Analysis Speech-to-Speech với 82.6. Gemini 3.8 Flash là mô hình văn bản nhanh. Live mới là cuộc gọi giọng nói.

Sự kiện · 2026-09-15 Speech-to-speech Dùng thử bên dưới

File the recap. Keep the live call.

Paste a podcast, lecture, or meeting URL — BibiGPT turns it into chapters, a transcript, and follow-up Q&A.

Thêm BibiGPT làm nguồn ưu tiên trên Google Xem thêm nội dung BibiGPT trong Tin bài hàng đầu và câu trả lời AI.

Sự kiện chính (đọc 90 giây)

Tính đến 2026-09-16, Google đưa Gemini 3.8 Live và 3.8 Live Extended Thinking vào Live API ngày 2026-09-15: Speech-to-Speech gốc, chuyển nóng 97 ngôn ngữ, gọi công cụ bất đồng bộ, ngữ cảnh hình ảnh. Audio vào $0.005/phút, ra $0.018/phút. Extended Thinking dẫn Artificial Analysis Speech-to-Speech với 82.6. Đây là sản phẩm hội thoại thời gian thực, không phải engine tóm tắt.

Features

Google thực sự phát hành gì ngày 2026-09-15

Các con số công khai lấy từ thông báo Live API và tài liệu dành cho nhà phát triển của Google — không phải tuyên bố rằng BibiGPT đang chạy mô hình này.

Speech-to-Speech gốc, không phải chuỗi cascade

Gemini 3.8 Live dùng cùng một mô hình để xử lý âm thanh vào và ra. Đối phương có thể ngắt lời, đổi ngôn ngữ giữa lượt, hoặc tiếp tục nói trong lúc công cụ chạy. Đó là cuộc gọi trực tiếp, không phải bản tổng kết.

Speech-to-Speech 82.6; $0.005 / $0.018 mỗi phút

Google công bố Gemini 3.8 Live Extended Thinking đạt 82.6 trên Artificial Analysis Speech-to-Speech, cao hơn GPT-Live-1-Astra. Audio đầu vào $0.005/phút, đầu ra $0.018/phút. Điểm số và giá niêm yết đó là của Google, được thuật lại ở đây.

97 ngôn ngữ, ngữ cảnh hình ảnh, SKU Transcribe riêng

Mô hình Live hiểu và tạo giọng nói ở 97 ngôn ngữ, và có thể đổi giữa cuộc hội thoại. Đầu vào gồm văn bản, ảnh, audio và video. Cùng ngày, Gemini 3.5 Transcribe — SKU speech-to-text riêng, 85+ ngôn ngữ — vào Gemini API.

Vì sao lớp giọng thời gian thực vẫn để lại khoảng trống ghi chú

Ngắt lời mượt hơn không gắn dấu thời gian cho quyết định tuần trước. Công việc tri thức vẫn cần file bạn tìm lại được vào thứ Ba tuần sau.

Nói trực tiếp không phải kho lưu tìm được

Gemini 3.8 Live có thể tiếp tục nói trong lúc gọi công cụ chạy nền. Sau cuộc gọi, bạn vẫn cần chương, bản ghi lời, và câu nói tìm lại được. Việc đó là bất đồng bộ.

Họp đã chiếm khoảng 30% tuần làm việc

Laxis State of Meetings 2026: người làm tri thức ngồi trung bình 21,7 cuộc họp mỗi tuần, khoảng 30% tuần làm việc. Phút trực tiếp rẻ hơn không thu gọn đống đó. Bản tổng kết có dấu thời gian thì có.

Podcast khóa thời gian, không khóa nguồn cung

Edison Infinite Dial 2026: thính giả Mỹ trung bình nghe 8 giờ 24 phút mỗi tuần, theo dõi 6,8 chương trình. Những tập chưa nghe cần bàn phân loại, không cần thêm một giọng thời gian thực. Tóm tắt quyết định 72 phút hôm nay dành cho tập nào.

5 thay đổi chính (đọc 90 giây)

Những thay đổi nổi bật từ lần phát hành Gemini Live API ngày 2026-09-15 của Google.

  1. 1

    Speech-to-Speech gốc, không còn cascade

    Cùng một mô hình xử lý âm thanh vào và ra cùng lúc. Ngắt lời, đổi ngôn ngữ và phụ họa nằm trong cùng phiên. Chuỗi cũ phiên âm rồi hiểu rồi nói phải chờ hết lượt.

  2. 2

    Extended Thinking Speech-to-Speech 82.6

    Google công bố Gemini 3.8 Live Extended Thinking đạt 82.6 trên Artificial Analysis Speech-to-Speech, xếp #1 tổng thể, cao hơn GPT-Live-1-Astra. Bản thân Live xếp thứ hai trên Speech Agent Arena. Đây là đánh giá của Google, được thuật lại ở đây, không phải bài test chúng tôi chạy.

  3. 3

    Vào $0.005/phút, ra $0.018/phút

    Trên Live API, audio đầu vào $0.005 mỗi phút và đầu ra $0.018 mỗi phút. Lớp phía trước của GPT-Live-1 là $0.05/phút. Giá niêm yết là của Google và OpenAI, không phải SKU BibiGPT.

  4. 4

    Công cụ bất đồng bộ, ngữ cảnh hình ảnh, 97 ngôn ngữ

    Gọi công cụ chạy nền trong lúc audio vẫn stream. Đầu vào: văn bản, ảnh, audio, video. Mô hình hiểu và tạo giọng nói ở 97 ngôn ngữ, và có thể đổi giữa cuộc hội thoại. Tài liệu dành cho nhà phát triển liệt kê gemini-3.8-live là mặc định độ trễ thấp.

  5. 5

    Lớp thời gian thực, cộng SKU Transcribe riêng

    Cùng ngày, Gemini 3.5 Transcribe vào Gemini API: speech-to-text chuyên dụng, 85+ ngôn ngữ, streaming WER 4.0% / non-streaming 2.6% (Artificial Analysis, Google trích dẫn). Sau phiên, bạn vẫn cần chương tìm được vào tuần sau. Đó là đường BibiGPT, không phải tích hợp Live.

3 tình huống điển hình cho người dùng BibiGPT

Nơi lớp giọng thời gian thực thực sự giúp ích — và nơi quy trình ghi chú vẫn phải làm việc.

Bạn làm hoặc cắt một podcast mỗi tuần

Thính giả Mỹ trung bình nghe 8 giờ 24 phút mỗi tuần, theo dõi 6,8 chương trình (Edison Infinite Dial 2026). API giọng thời gian thực không phân loại được đống tồn. Hãy tạo chương trước, rồi quyết giờ nào đáng nghe trọn.

Bạn ngồi hơn 20 cuộc họp mỗi tuần

Laxis 2026: 21,7 cuộc họp mỗi tuần, khoảng 30% tuần làm việc. Phút trực tiếp rẻ hơn hữu ích trong cuộc gọi. Thứ Ba tuần sau bạn vẫn cần câu đã quyết. Lưu bản ghi; tìm trong bản ghi lời.

Bạn đã có bản ghi bài giảng

Dán liên kết. Xem chương trước khi quyết định phát, nhảy tới dấu thời gian, xuất Markdown. Gemini 3.8 Live không cần nằm trong vòng. Quy trình ghi chú đã chạy trên file bạn đang có.

Trang BibiGPT liên quan

Quy trình ghi chú mới là sản phẩm. Blog giữ so sánh dài. Trang này giữ sự kiện.

Nguồn

Các tuyên bố ra mắt lấy từ thông báo Google và đưa tin độc lập. Cập nhật lần cuối 2026-09-16. Không phải tuyên bố tích hợp.

Gemini 3.8 Live là gì?

Gemini 3.8 Live là gì?

Gemini 3.8 Live là mô hình Speech-to-Speech gốc của Google trong Live API, phát hành ngày 2026-09-15. Speech-to-Speech nghĩa là cùng một mô hình vừa nghe vừa nói, không phải chuỗi phiên âm rồi hiểu rồi tổng hợp giọng. Nó xử lý lượt thoại trực tiếp. Nó không lưu bản tổng kết tìm được của cuộc gọi.

Được các nhà sáng tạo, sinh viên và nhà nghiên cứu yêu thích

Lý do mọi người dùng BibiGPT mỗi ngày để chuyển video thành văn bản.

Được hơn 50.000 người dùng trên toàn thế giới tin dùng

★★★★★

“Tôi chỉ cần dán liên kết là có ngay phụ đề sạch sẽ trong vài giây — tiết kiệm hàng giờ gõ lại mỗi tuần.”

Maya R.

Nhà sáng tạo nội dung · Tái sử dụng video ngắn

★★★★★

“Xuất bản ghi giúp tôi ôn từ mới theo nhịp độ riêng thay vì liên tục tạm dừng video.”

Daniel K.

Người học ngoại ngữ · Học qua video thực tế

★★★★★

“Văn bản chính xác kèm dấu thời gian, có thể trích dẫn trực tiếp. Nó đã lặng lẽ trở thành một phần công việc hằng ngày của tôi.”

Priya S.

Nhà nghiên cứu · Trích dẫn các buổi nói chuyện công khai

Câu hỏi thường gặp

Hỏi chúng tôi bất cứ điều gì.

Popular guides

Cuộc gọi trực tiếp để lại cho nó. Tổng kết để lại cho ghi chú.

Dán podcast, bài giảng hoặc bản ghi họp vào BibiGPT. Bạn nhận chương, bản ghi lời tìm được và hỏi đáp theo dõi. Gemini 3.8 Live xử lý ngắt lời. Ghi chú vẫn cần dấu thời gian.