Apa itu ASR streaming?
Pengenalan ucapan otomatis streaming mengubah suara jadi teks saat audio masih masuk, tanpa menunggu file selesai. Teks parsial muncul dulu, lalu bisa dikoreksi. Ini desain jeda, bukan nama merek.
Per 2026-09-07: Meta Superintelligence Labs merilis Muse Voice Transcribe pada 2026-09-01, ASR streaming real-time dalam potongan 80ms, model yang sama untuk diarisasi 20+ pembicara dan deteksi endpoint. Meta mengklaim peringkat pertama di papan streaming speech-to-text Artificial Analysis per 2026-09-01. Kalau kamu hanya ingin mengubah file atau tautan kuliah jadi teks, pakai alat di bawah — tidak perlu buka konsol Meta API.
Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without opening Meta Model API.
Per 2026-09-07: Meta Superintelligence Labs merilis Muse Voice Transcribe pada 2026-09-01. Ini model persepsi audio real-time: ASR streaming 80ms, diarisasi 20+, deteksi endpoint, satu pass. Meta mengklaim peringkat pertama papan streaming speech-to-text Artificial Analysis per 2026-09-01. Meta Model API 0,18 dolar per jam audio. Pembaruan terakhir: 2026-09-07.
Ini model persepsi audio real-time yang di-host Meta Superintelligence Labs, keluarga Muse Spark. Bukan Muse Image. ID model di dokumen Meta adalah muse-voice-transcribe-1.0.
Audio dipotong 80ms, 12.5 Hz. Model sendiri memutuskan terus mendengar atau mengeluarkan potongan teks. Meta menyebut ini jeda adaptif: reinforcement learning menyeimbangkan 「tunggu sebentar lagi」 dan 「kata lebih akurat」.
Label pembicara mencakup lebih dari 20 orang. Tanda endpoint menandai awal dan akhir ucapan. Meta bilang langkah pascaproses terpisah tidak perlu. Acuannya halaman riset.
Dokumen speech-to-text Meta mencantumkan 0,18 dolar per jam audio (3 dolar per 1000 menit), streaming dan unggah file harga sama. Tidak ada bobot open source. Dikte suara di Meta AI for Mac dan Muse Code sudah memakai model ini.
API ASR real-time membantu tim yang merakit asisten suara. Itu tidak mengganti produk yang mengarsip transkrip berstempel waktu, bab, dan pertanyaan lanjutan untuk manusia — yang sering cukup dengan menempel tautan.
Tempel tautan kuliah atau podcast, atau tarik MP3. Yang kamu butuhkan transkrip yang bisa dicari, bukan WebSocket wss://api.meta.ai/v1/asr/realtime.
Teks streaming masih harus dibaca orang. BibiGPT menerima file atau tautan yang sama, mengembalikan bab, transkrip berstempel waktu, dan catatan yang bisa ditanya.
Muse Image adalah rilis Meta 2026 yang lain. Setiap niat punya URL sendiri. Halaman ini hanya mencakup model suara 09-01.
Fakta inti dari rilis Muse Voice Transcribe Meta 2026-09-01.
Meta Superintelligence Labs menayangkan muse-voice-transcribe-1.0. Tersedia lewat Meta Model API, Meta AI for Mac, dan Muse Code. Tidak ada bobot open source. Di Mac, tahan Fn untuk dikte lewat Meta AI.
Audio setiap 80ms (12.5 Hz) jadi satu potongan teks. Model memilih terus mendengar atau mengeluarkan teks. Jeda adaptif dilatih reinforcement learning, mengalikan hadiah kesalahan kata dengan hadiah jeda — kata sulit menunggu lebih lama.
Tanda khusus menandai ganti pembicara, label A–Z (20+ orang), onset dan endpoint. Meta bilang audio lebih dari satu jam juga tidak butuh alur pascaproses tambahan.
Saat peluncuran Meta menyarankan 25 bahasa yang sudah diverifikasi; sisanya tetap bisa dicoba. Alih kode dalam dan antar kalimat bersifat native. Bias bahasa, kata kunci, dan konteks menaikkan akurasi nama diri dan jargon.
Dokumen Meta mencantumkan 0,18 dolar per jam audio. Meta mengklaim peringkat pertama streaming speech-to-text dan diarisasi publik Artificial Analysis per 2026-09-01. VentureBeat mengutip slide rilis: AA-WER Streaming kesalahan kata naskah akhir 3,1%.
Di mana API ASR real-time penting — dan pekerjaan nyata produk 「tautan jadi catatan」.
Tim yang butuh hasil parsial WebSocket dan deteksi batas giliran bisa menilai Meta Model API. Lalu masukkan rekaman jadi ke BibiGPT supaya orang mendapat bab, bukan deret peristiwa mentah.
Kuliah 90 menit tidak butuh soket ASR real-time. Tempel URL atau jatuhkan M4A, ekspor transkrip berstempel waktu, lanjut bertanya. Itu jalur produk.
Muse Voice Transcribe adalah ASR streaming Meta 09-01. Granite Speech 5.0 Turbo CTC adalah bobot throughput bahasa Inggris IBM. Gemini 3.5 Transcribe rilis 2026-08-26, live dan file API berbeda. Setiap keluarga satu URL; jangan menyatukan halaman 「ASR 2026」 yang kabur.
Alur transkrip dan catatan yang menemani rilis ini.
Jatuhkan MP3, WAV, atau M4A, dapatkan teks berstempel waktu.
Ubah tautan atau file video jadi transkrip yang bisa dicari.
Ambil transkrip lengkap dari URL YouTube.
Halaman peristiwa ASR bahasa Inggris IBM 2026-08-25.
Rilis Muse lain — gambar, bukan suara.
Fakta rilis dari tulisan Meta sendiri. Harga dan slide papan streaming dari liputan independen dicatat terpisah.
2026-09-01 Meta Superintelligence Labs merilis Muse Voice Transcribe sebagai model persepsi audio real-time pertama keluarga Muse Spark: ASR streaming 80ms, diarisasi 20+, deteksi endpoint, pelatihan 70+ bahasa (25 diverifikasi cukup), alih kode native, dukungan native audio lebih dari satu jam. Meta mengklaim peringkat pertama papan streaming speech-to-text Artificial Analysis per 2026-09-01.
Meta AI Research — Introducing Muse Voice Transcribe ↗Dokumen speech-to-text Meta mencantumkan model muse-voice-transcribe-1.0, WebSocket real-time dan POST file, 0,18 dolar per jam audio, stempel waktu tingkat giliran (bukan tingkat kata), serta 25 bahasa evaluasi dan alih kode.
Meta AI Developer — Speech to text ↗VentureBeat (2026-09) memberitakan harga 0,18 dolar/jam dan mengutip slide rilis Meta: AA-WER Streaming Artificial Analysis kesalahan kata naskah akhir 3,1%, lebih rendah dari sistem streaming lain di slide yang sama.
VentureBeat — Meta prices Muse Voice Transcribe at $0.18 an hour ↗Gemini 3.5 Transcribe (2026-08-26) adalah rilis Google lain: angka Artificial Analysis yang dikutip Google adalah WER streaming 4,0%, WER non-streaming 2,6%, 85+ bahasa. Live dan file API berbeda. Titik data 2026-08.
Google — Gemini 3.5 Transcribe launch(zettel dt-bibigpt-0008) ↗Pengenalan ucapan otomatis streaming mengubah suara jadi teks saat audio masih masuk, tanpa menunggu file selesai. Teks parsial muncul dulu, lalu bisa dikoreksi. Ini desain jeda, bukan nama merek.
Diarisasi menandai 「siapa bicara kapan」 di rekaman. Sistem memberi tag pembicara pada giliran agar notulen rapat memisahkan suara. Klaim 20+ orang hanya berarti kumpulan tag cukup besar, bukan mengenali nama setiap orang.
Deteksi endpoint menandai awal dan akhir ucapan agar asisten suara tahu kapan berhenti mendengar dan mulai menjawab. Ini pergantian giliran, bukan tanda baca. Model mengeluarkan tanda onset dan endpoint, bukan menunggu tombol stop.
Mengapa banyak orang memakai BibiGPT setiap hari untuk mengubah video menjadi teks.
Dipercaya 50.000+ pengguna di seluruh dunia
“Saya tempel tautan dan dalam hitungan detik mendapat teks subtitle yang rapi — menghemat berjam-jam mengetik ulang setiap minggu.”
Maya R.
Kreator konten · Mendaur ulang video pendek
“Dengan mengekspor transkrip, saya bisa mengulang kosakata baru sesuai kecepatan sendiri tanpa terus menjeda video.”
Daniel K.
Pembelajar bahasa · Belajar dengan video asli
“Teks akurat dengan stempel waktu yang bisa langsung saya kutip. Diam-diam sudah jadi bagian dari rutinitas harian saya.”
Priya S.
Peneliti · Mengutip ceramah publik
FAQ
Tanyakan apa pun.
1 Install a video-summary skill into DeepSeek Harness in one copy-paste — SKILL.md matches Claude Code. Or skip dsh: paste a Bilibili or YouTube link in the browser and get a timestamped summary.
2 Tool ringkasan video AI Bilibili terbaik 2026? BibiGPT mendukung 30+ platform dengan 1 juta+ pengguna. Tempel link Bilibili untuk ringkasan terstruktur instan. Bandingkan top 5 tool plus otomasi AI agent.
3 Extract Bilibili subtitles free: paste a BV/av link for a transcript even with no captions. Compare 5 tools for SRT export and AI summary. No signup to start.
Tempel tautan YouTube, Bilibili, atau podcast — atau jatuhkan MP3, WAV, M4A. BibiGPT mengembalikan transkrip berstempel waktu, ringkasan AI, dan catatan yang bisa dicari. Pembaruan terakhir: 2026-09-07.