Muse Voice Transcribe 解説——2026-09-01 に Meta が出したもの

2026-09-07 時点:Meta Superintelligence Labs は 2026-09-01 に Muse Voice Transcribe を公開し、80ms チャンクのリアルタイムストリーミング音声認識と、同一モデルでの 20人以上の話者分離・エンドポイント検出を打ち出しました。Meta は 2026-09-01 時点で Artificial Analysis のストリーミング音声認識ランキング 1 位と述べています。ファイルや講義リンクを文字起こししたいだけなら、下のツールで十分です。Meta API コンソールは開きません。

公開 · 2026-09-01 80ms ストリーミング音声認識 下で試せます

Transcribe a file right here

Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without opening Meta Model API.

BibiGPT を Google の優先ソースに追加 トップニュースと AI による回答に BibiGPT がもっと表示されます。

要点(90 秒)

2026-09-07 時点:Meta Superintelligence Labs は 2026-09-01 に Muse Voice Transcribe を公開しました。リアルタイム音声知覚モデルで、80ms ストリーミング音声認識、20人以上の話者分離、エンドポイント検出を一度に行います。Meta は 2026-09-01 時点で Artificial Analysis ストリーミング音声認識 1 位と述べています。Meta Model API は音声 1 時間 0.18 ドルです。最終更新:2026-09-07。

Features

Muse Voice Transcribe の実態

Meta Superintelligence Labs のホスト型リアルタイム音声知覚モデルで、Muse Spark ファミリーに属します。Muse Image ではありません。Meta ドキュメント上のモデル ID は muse-voice-transcribe-1.0 です。

80ms ストリーミング音声認識(2026-09-01)

音声は 80ms、12.5 Hz でチャンク化されます。モデルは聞き続けるか、テキスト断片を出すかを自分で決めます。Meta はこれを適応遅延と呼び、強化学習で「もう少し待つ」と「語の精度」を釣り合わせます。

話者分離とエンドポイント検出は同一パス

話者ラベルは 20 人超をカバーします。終端の印が発話の開始と終了を示します。Meta は別途の後処理ステップは不要と述べています。根拠は研究ページです。

音声 1 時間 0.18 ドル、API のみ

Meta の音声認識ドキュメントでは、1 時間あたり 0.18 ドル(1000 分あたり 3 ドル)、ストリーミングとファイルアップロードは同額です。オープンな重みはありません。Mac の Meta AI と Muse Code の音声入力はすでにこのモデルを使っています。

長時間音声を扱うなら、何が変わるか

リアルタイム音声認識 API が助けるのは音声アシスタントを作るチームです。人間がタイムスタンプ付き文字起こし、章立て、追加質問でアーカイブする製品の代わりにはなりません。後者はリンクを貼るだけで済むことが多いです。

Model API コンソールは不要

講義やポッドキャストのリンクを貼るか、MP3 をドロップしてください。欲しいのは検索できる文字起こしであり、wss://api.meta.ai/v1/asr/realtime の WebSocket ではありません。

文字起こしはインターフェースであり、完成品ではない

ストリーミング原文はまだ人が読む必要があります。BibiGPT は同じファイルやリンクを受け取り、章、タイムスタンプ付き文字起こし、質問できるノートを返します。

これは Voice Transcribe であり、Muse Image ではない

Muse Image は Meta の別の 2026 リリースです。意図ごとに URL を分けます。本ページは 09-01 の音声モデルだけを扱います。

5 つの変化(90 秒)

Meta の 2026-09-01 Muse Voice Transcribe 発表からの核心事実です。

  1. 1

    2026-09-01 公開、ホストのみ

    Meta Superintelligence Labs は muse-voice-transcribe-1.0 で投入しました。Meta Model API、Mac 版 Meta AI、Muse Code で使えます。オープンな重みはありません。Mac では Fn を押し続けると Meta AI で音声入力できます。

  2. 2

    80ms チャンクと適応遅延

    音声は 80ms(12.5 Hz)ごとに断片になります。モデルは聞き続けるか文字を出すかを選びます。適応遅延は強化学習で、語誤り報酬と遅延報酬を掛け合わせ、難しい語は長く待ちます。

  3. 3

    話者分離とエンドポイント検出は認識パスを共有

    特殊な印 が話者切替、話者ラベル A–Z(20人以上)、onset と endpoint を示します。Meta は 1 時間超の長音声でも追加の後処理フローは不要と述べています。

  4. 4

    学習 70+ 言語、検証 25 言語

    初回は十分に検証された 25 言語から試すのが Meta の推奨で、他も試せます。文内・文間のコードスイッチはネイティブです。言語・キーワード・文脈バイアスで固有名や専門語の精度を上げられます。

  5. 5

    1 時間 0.18 ドルと独立ストリーミングランキング

    Meta ドキュメントは音声 1 時間 0.18 ドルと記載します。Meta は 2026-09-01 時点で Artificial Analysis のストリーミング音声認識と公開話者分離で 1 位と述べています。VentureBeat は発表図の AA-WER Streaming 最終稿語誤り率 3.1% を引用しています。

BibiGPT ユーザーの 3 つの典型シーン

リアルタイム音声認識 API が効く場所と、「リンクをノートにする」製品が本当にやる仕事です。

音声アシスタントを作っている

WebSocket の部分結果とターン境界検出が必要なチームは Meta Model API を評価できます。完成した録音は BibiGPT に渡し、生イベント列ではなく章立てを人に渡してください。

授業録音を文字起こししたいだけ

90 分の講義にリアルタイム音声認識ソケットは不要です。URL を貼るか M4A をドロップし、タイムスタンプ付き文字起こしを書き出して質問を続けます。それが製品パスです。

2026 の音声リリースを追っている

Muse Voice Transcribe は Meta の 09-01 ストリーミング音声認識です。Granite Speech 5.0 Turbo CTC は IBM の英語スループット重みです。Gemini 3.5 Transcribe は 2026-08-26 公開で、ライブとファイルは別 API です。ファミリーごとに URL を分け、「2026 音声認識」の雑な一枚絵は作らないでください。

関連する BibiGPT ツール

今回の発表とセットになる文字起こしとノートのワークフローです。

出典

発表事実は Meta 自身の記事です。料金とストリーミング図の独立報道は別に記します。

  • 2026-09-01、Meta Superintelligence Labs は Muse Voice Transcribe を Muse Spark ファミリー初のリアルタイム音声知覚モデルとして公開:80ms ストリーミング音声認識、20人以上の話者分離、エンドポイント検出、学習 70+ 言語(25 言語を十分に検証)、ネイティブなコードスイッチ、1 時間超の長音声をネイティブに扱う。Meta は 2026-09-01 時点で Artificial Analysis ストリーミング音声認識 1 位と述べています。

    Meta AI Research — Introducing Muse Voice Transcribe ↗
  • Meta の音声認識ドキュメントはモデル muse-voice-transcribe-1.0、リアルタイム WebSocket とファイル POST、音声 1 時間 0.18 ドル、ターン単位のタイムスタンプ(語単位ではない)、25 の評価言語とコードスイッチを記載しています。

    Meta AI Developer — Speech to text ↗
  • VentureBeat(2026-09)は 0.18 ドル/時間の料金を報じ、Meta 発表図の Artificial Analysis AA-WER Streaming 最終稿語誤り率 3.1% を引用しています。同図上の他ストリーミングシステムより低い数字です。

    VentureBeat — Meta prices Muse Voice Transcribe at $0.18 an hour ↗
  • Gemini 3.5 Transcribe(2026-08-26)は Google の別リリースです。Google が引用する Artificial Analysis はストリーミング WER 4.0%、非ストリーミング WER 2.6%、85+ 言語です。ライブとファイルは別 API です。データ時点は 2026-08。

    Google — Gemini 3.5 Transcribe launch(zettel dt-bibigpt-0008) ↗

このページの用語

ストリーミング音声認識とは何ですか?

ストリーミング自動音声認識は、ファイルの終わりを待たず、音声が流れている途中で文字にします。部分的な文字 が先に出て、あとから直ることもあります。遅延の設計であり、ブランド名ではありません。

話者分離とは何ですか?

話者分離は録音の「誰がいつ話したか」にラベルを付けます。ターンに話者タグを割り当て、会議録で声を分けます。20人以上というのはタグ集合が大きいという意味であり、全員の名前を知る保証ではありません。

音声認識のエンドポイント検出とは何ですか?

エンドポイント検出は発話の開始と終了を示し、音声アシスタントがいつ聞き終わり、いつ答え始めるかを決めます。これはターン切り替えであり、句読点ではありません。モデルが onset と 終端の印 を出し、停止ボタン待ちではありません。

クリエイター・学生・研究者に愛用されています

動画をテキスト化するために、毎日 BibiGPT が選ばれている理由。

全世界 50,000 人以上のユーザーが利用中

★★★★★

“リンクを貼るだけで数秒でクリーンな字幕テキストが手に入り、毎週何時間もの書き起こし作業が不要になりました。”

Maya R.

コンテンツクリエイター · ショート動画を再編集

★★★★★

“文字起こしをエクスポートできるので、動画を何度も止めずに自分のペースで新しい単語を復習できます。”

Daniel K.

語学学習者 · 生の動画で学習

★★★★★

“タイムスタンプ付きの正確なテキストをそのまま引用できます。いつの間にか毎日のワークフローの一部になりました。”

Priya S.

研究者 · 公開講演を引用

よくある質問

ご質問はありますか?お気軽にどうぞ!

人気の記事

API の握手は飛ばして、ここで文字起こし

YouTube、Bilibili、ポッドキャストのリンクを貼るか、MP3・WAV・M4A をドロップしてください。BibiGPT はタイムスタンプ付き文字起こし、AI 要約、検索できるノートを返します。最終更新:2026-09-07。