Penjelasan Muse Voice Transcribe — apa yang Meta rilis 2026-09-01

Per 2026-09-07: Meta Superintelligence Labs merilis Muse Voice Transcribe pada 2026-09-01, ASR streaming real-time dalam potongan 80ms, model yang sama untuk diarisasi 20+ pembicara dan deteksi endpoint. Meta mengklaim peringkat pertama di papan streaming speech-to-text Artificial Analysis per 2026-09-01. Kalau kamu hanya ingin mengubah file atau tautan kuliah jadi teks, pakai alat di bawah — tidak perlu buka konsol Meta API.

Rilis · 2026-09-01 ASR streaming 80ms Coba di bawah

Transcribe a file right here

Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without opening Meta Model API.

Jadikan BibiGPT sumber pilihan di Google Lihat lebih banyak BibiGPT di Berita Utama dan jawaban AI.

Fakta utama (90 detik)

Per 2026-09-07: Meta Superintelligence Labs merilis Muse Voice Transcribe pada 2026-09-01. Ini model persepsi audio real-time: ASR streaming 80ms, diarisasi 20+, deteksi endpoint, satu pass. Meta mengklaim peringkat pertama papan streaming speech-to-text Artificial Analysis per 2026-09-01. Meta Model API 0,18 dolar per jam audio. Pembaruan terakhir: 2026-09-07.

Features

Apa sebenarnya Muse Voice Transcribe

Ini model persepsi audio real-time yang di-host Meta Superintelligence Labs, keluarga Muse Spark. Bukan Muse Image. ID model di dokumen Meta adalah muse-voice-transcribe-1.0.

ASR streaming 80ms (2026-09-01)

Audio dipotong 80ms, 12.5 Hz. Model sendiri memutuskan terus mendengar atau mengeluarkan potongan teks. Meta menyebut ini jeda adaptif: reinforcement learning menyeimbangkan 「tunggu sebentar lagi」 dan 「kata lebih akurat」.

Diarisasi dan deteksi endpoint dalam satu pass

Label pembicara mencakup lebih dari 20 orang. Tanda endpoint menandai awal dan akhir ucapan. Meta bilang langkah pascaproses terpisah tidak perlu. Acuannya halaman riset.

0,18 dolar per jam audio, hanya API

Dokumen speech-to-text Meta mencantumkan 0,18 dolar per jam audio (3 dolar per 1000 menit), streaming dan unggah file harga sama. Tidak ada bobot open source. Dikte suara di Meta AI for Mac dan Muse Code sudah memakai model ini.

Kalau kamu mengolah audio panjang, artinya apa

API ASR real-time membantu tim yang merakit asisten suara. Itu tidak mengganti produk yang mengarsip transkrip berstempel waktu, bab, dan pertanyaan lanjutan untuk manusia — yang sering cukup dengan menempel tautan.

Tidak perlu buka konsol Model API

Tempel tautan kuliah atau podcast, atau tarik MP3. Yang kamu butuhkan transkrip yang bisa dicari, bukan WebSocket wss://api.meta.ai/v1/asr/realtime.

Transkrip adalah lapisan antarmuka, bukan barang jadi

Teks streaming masih harus dibaca orang. BibiGPT menerima file atau tautan yang sama, mengembalikan bab, transkrip berstempel waktu, dan catatan yang bisa ditanya.

Ini Voice Transcribe, bukan Muse Image

Muse Image adalah rilis Meta 2026 yang lain. Setiap niat punya URL sendiri. Halaman ini hanya mencakup model suara 09-01.

5 perubahan kunci (90 detik)

Fakta inti dari rilis Muse Voice Transcribe Meta 2026-09-01.

  1. 1

    Rilis 2026-09-01, hanya hosting

    Meta Superintelligence Labs menayangkan muse-voice-transcribe-1.0. Tersedia lewat Meta Model API, Meta AI for Mac, dan Muse Code. Tidak ada bobot open source. Di Mac, tahan Fn untuk dikte lewat Meta AI.

  2. 2

    Potongan 80ms dan jeda adaptif

    Audio setiap 80ms (12.5 Hz) jadi satu potongan teks. Model memilih terus mendengar atau mengeluarkan teks. Jeda adaptif dilatih reinforcement learning, mengalikan hadiah kesalahan kata dengan hadiah jeda — kata sulit menunggu lebih lama.

  3. 3

    Diarisasi dan endpoint berbagi pass pengenalan

    Tanda khusus menandai ganti pembicara, label A–Z (20+ orang), onset dan endpoint. Meta bilang audio lebih dari satu jam juga tidak butuh alur pascaproses tambahan.

  4. 4

    Latih 70+ bahasa, verifikasi 25

    Saat peluncuran Meta menyarankan 25 bahasa yang sudah diverifikasi; sisanya tetap bisa dicoba. Alih kode dalam dan antar kalimat bersifat native. Bias bahasa, kata kunci, dan konteks menaikkan akurasi nama diri dan jargon.

  5. 5

    0,18 dolar per jam plus papan streaming independen

    Dokumen Meta mencantumkan 0,18 dolar per jam audio. Meta mengklaim peringkat pertama streaming speech-to-text dan diarisasi publik Artificial Analysis per 2026-09-01. VentureBeat mengutip slide rilis: AA-WER Streaming kesalahan kata naskah akhir 3,1%.

3 skenario khas pengguna BibiGPT

Di mana API ASR real-time penting — dan pekerjaan nyata produk 「tautan jadi catatan」.

Kamu sedang merakit asisten suara

Tim yang butuh hasil parsial WebSocket dan deteksi batas giliran bisa menilai Meta Model API. Lalu masukkan rekaman jadi ke BibiGPT supaya orang mendapat bab, bukan deret peristiwa mentah.

Kamu hanya ingin transkrip rekaman kelas

Kuliah 90 menit tidak butuh soket ASR real-time. Tempel URL atau jatuhkan M4A, ekspor transkrip berstempel waktu, lanjut bertanya. Itu jalur produk.

Kamu mengikuti rilis suara 2026

Muse Voice Transcribe adalah ASR streaming Meta 09-01. Granite Speech 5.0 Turbo CTC adalah bobot throughput bahasa Inggris IBM. Gemini 3.5 Transcribe rilis 2026-08-26, live dan file API berbeda. Setiap keluarga satu URL; jangan menyatukan halaman 「ASR 2026」 yang kabur.

Alat BibiGPT terkait

Alur transkrip dan catatan yang menemani rilis ini.

Sumber

Fakta rilis dari tulisan Meta sendiri. Harga dan slide papan streaming dari liputan independen dicatat terpisah.

  • 2026-09-01 Meta Superintelligence Labs merilis Muse Voice Transcribe sebagai model persepsi audio real-time pertama keluarga Muse Spark: ASR streaming 80ms, diarisasi 20+, deteksi endpoint, pelatihan 70+ bahasa (25 diverifikasi cukup), alih kode native, dukungan native audio lebih dari satu jam. Meta mengklaim peringkat pertama papan streaming speech-to-text Artificial Analysis per 2026-09-01.

    Meta AI Research — Introducing Muse Voice Transcribe ↗
  • Dokumen speech-to-text Meta mencantumkan model muse-voice-transcribe-1.0, WebSocket real-time dan POST file, 0,18 dolar per jam audio, stempel waktu tingkat giliran (bukan tingkat kata), serta 25 bahasa evaluasi dan alih kode.

    Meta AI Developer — Speech to text ↗
  • VentureBeat (2026-09) memberitakan harga 0,18 dolar/jam dan mengutip slide rilis Meta: AA-WER Streaming Artificial Analysis kesalahan kata naskah akhir 3,1%, lebih rendah dari sistem streaming lain di slide yang sama.

    VentureBeat — Meta prices Muse Voice Transcribe at $0.18 an hour ↗
  • Gemini 3.5 Transcribe (2026-08-26) adalah rilis Google lain: angka Artificial Analysis yang dikutip Google adalah WER streaming 4,0%, WER non-streaming 2,6%, 85+ bahasa. Live dan file API berbeda. Titik data 2026-08.

    Google — Gemini 3.5 Transcribe launch(zettel dt-bibigpt-0008) ↗

Istilah di halaman ini

Apa itu ASR streaming?

Pengenalan ucapan otomatis streaming mengubah suara jadi teks saat audio masih masuk, tanpa menunggu file selesai. Teks parsial muncul dulu, lalu bisa dikoreksi. Ini desain jeda, bukan nama merek.

Apa itu diarisasi pembicara?

Diarisasi menandai 「siapa bicara kapan」 di rekaman. Sistem memberi tag pembicara pada giliran agar notulen rapat memisahkan suara. Klaim 20+ orang hanya berarti kumpulan tag cukup besar, bukan mengenali nama setiap orang.

Apa deteksi endpoint dalam ASR?

Deteksi endpoint menandai awal dan akhir ucapan agar asisten suara tahu kapan berhenti mendengar dan mulai menjawab. Ini pergantian giliran, bukan tanda baca. Model mengeluarkan tanda onset dan endpoint, bukan menunggu tombol stop.

Disukai kreator, pelajar & peneliti

Mengapa banyak orang memakai BibiGPT setiap hari untuk mengubah video menjadi teks.

Dipercaya 50.000+ pengguna di seluruh dunia

★★★★★

“Saya tempel tautan dan dalam hitungan detik mendapat teks subtitle yang rapi — menghemat berjam-jam mengetik ulang setiap minggu.”

Maya R.

Kreator konten · Mendaur ulang video pendek

★★★★★

“Dengan mengekspor transkrip, saya bisa mengulang kosakata baru sesuai kecepatan sendiri tanpa terus menjeda video.”

Daniel K.

Pembelajar bahasa · Belajar dengan video asli

★★★★★

“Teks akurat dengan stempel waktu yang bisa langsung saya kutip. Diam-diam sudah jadi bagian dari rutinitas harian saya.”

Priya S.

Peneliti · Mengutip ceramah publik

Pertanyaan yang Sering Diajukan

Tanyakan apa pun.

Popular guides

Lewati jabat tangan API, transkrip suara di sini

Tempel tautan YouTube, Bilibili, atau podcast — atau jatuhkan MP3, WAV, M4A. BibiGPT mengembalikan transkrip berstempel waktu, ringkasan AI, dan catatan yang bisa dicari. Pembaruan terakhir: 2026-09-07.