ストリーミング音声認識とは何ですか?
ストリーミング自動音声認識は、ファイルの終わりを待たず、音声が流れている途中で文字にします。部分的な文字 が先に出て、あとから直ることもあります。遅延の設計であり、ブランド名ではありません。
2026-09-07 時点:Meta Superintelligence Labs は 2026-09-01 に Muse Voice Transcribe を公開し、80ms チャンクのリアルタイムストリーミング音声認識と、同一モデルでの 20人以上の話者分離・エンドポイント検出を打ち出しました。Meta は 2026-09-01 時点で Artificial Analysis のストリーミング音声認識ランキング 1 位と述べています。ファイルや講義リンクを文字起こししたいだけなら、下のツールで十分です。Meta API コンソールは開きません。
Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without opening Meta Model API.
2026-09-07 時点:Meta Superintelligence Labs は 2026-09-01 に Muse Voice Transcribe を公開しました。リアルタイム音声知覚モデルで、80ms ストリーミング音声認識、20人以上の話者分離、エンドポイント検出を一度に行います。Meta は 2026-09-01 時点で Artificial Analysis ストリーミング音声認識 1 位と述べています。Meta Model API は音声 1 時間 0.18 ドルです。最終更新:2026-09-07。
Meta Superintelligence Labs のホスト型リアルタイム音声知覚モデルで、Muse Spark ファミリーに属します。Muse Image ではありません。Meta ドキュメント上のモデル ID は muse-voice-transcribe-1.0 です。
音声は 80ms、12.5 Hz でチャンク化されます。モデルは聞き続けるか、テキスト断片を出すかを自分で決めます。Meta はこれを適応遅延と呼び、強化学習で「もう少し待つ」と「語の精度」を釣り合わせます。
話者ラベルは 20 人超をカバーします。終端の印が発話の開始と終了を示します。Meta は別途の後処理ステップは不要と述べています。根拠は研究ページです。
Meta の音声認識ドキュメントでは、1 時間あたり 0.18 ドル(1000 分あたり 3 ドル)、ストリーミングとファイルアップロードは同額です。オープンな重みはありません。Mac の Meta AI と Muse Code の音声入力はすでにこのモデルを使っています。
リアルタイム音声認識 API が助けるのは音声アシスタントを作るチームです。人間がタイムスタンプ付き文字起こし、章立て、追加質問でアーカイブする製品の代わりにはなりません。後者はリンクを貼るだけで済むことが多いです。
講義やポッドキャストのリンクを貼るか、MP3 をドロップしてください。欲しいのは検索できる文字起こしであり、wss://api.meta.ai/v1/asr/realtime の WebSocket ではありません。
ストリーミング原文はまだ人が読む必要があります。BibiGPT は同じファイルやリンクを受け取り、章、タイムスタンプ付き文字起こし、質問できるノートを返します。
Muse Image は Meta の別の 2026 リリースです。意図ごとに URL を分けます。本ページは 09-01 の音声モデルだけを扱います。
Meta の 2026-09-01 Muse Voice Transcribe 発表からの核心事実です。
Meta Superintelligence Labs は muse-voice-transcribe-1.0 で投入しました。Meta Model API、Mac 版 Meta AI、Muse Code で使えます。オープンな重みはありません。Mac では Fn を押し続けると Meta AI で音声入力できます。
音声は 80ms(12.5 Hz)ごとに断片になります。モデルは聞き続けるか文字を出すかを選びます。適応遅延は強化学習で、語誤り報酬と遅延報酬を掛け合わせ、難しい語は長く待ちます。
特殊な印 が話者切替、話者ラベル A–Z(20人以上)、onset と endpoint を示します。Meta は 1 時間超の長音声でも追加の後処理フローは不要と述べています。
初回は十分に検証された 25 言語から試すのが Meta の推奨で、他も試せます。文内・文間のコードスイッチはネイティブです。言語・キーワード・文脈バイアスで固有名や専門語の精度を上げられます。
Meta ドキュメントは音声 1 時間 0.18 ドルと記載します。Meta は 2026-09-01 時点で Artificial Analysis のストリーミング音声認識と公開話者分離で 1 位と述べています。VentureBeat は発表図の AA-WER Streaming 最終稿語誤り率 3.1% を引用しています。
リアルタイム音声認識 API が効く場所と、「リンクをノートにする」製品が本当にやる仕事です。
WebSocket の部分結果とターン境界検出が必要なチームは Meta Model API を評価できます。完成した録音は BibiGPT に渡し、生イベント列ではなく章立てを人に渡してください。
90 分の講義にリアルタイム音声認識ソケットは不要です。URL を貼るか M4A をドロップし、タイムスタンプ付き文字起こしを書き出して質問を続けます。それが製品パスです。
Muse Voice Transcribe は Meta の 09-01 ストリーミング音声認識です。Granite Speech 5.0 Turbo CTC は IBM の英語スループット重みです。Gemini 3.5 Transcribe は 2026-08-26 公開で、ライブとファイルは別 API です。ファミリーごとに URL を分け、「2026 音声認識」の雑な一枚絵は作らないでください。
今回の発表とセットになる文字起こしとノートのワークフローです。
発表事実は Meta 自身の記事です。料金とストリーミング図の独立報道は別に記します。
2026-09-01、Meta Superintelligence Labs は Muse Voice Transcribe を Muse Spark ファミリー初のリアルタイム音声知覚モデルとして公開:80ms ストリーミング音声認識、20人以上の話者分離、エンドポイント検出、学習 70+ 言語(25 言語を十分に検証)、ネイティブなコードスイッチ、1 時間超の長音声をネイティブに扱う。Meta は 2026-09-01 時点で Artificial Analysis ストリーミング音声認識 1 位と述べています。
Meta AI Research — Introducing Muse Voice Transcribe ↗Meta の音声認識ドキュメントはモデル muse-voice-transcribe-1.0、リアルタイム WebSocket とファイル POST、音声 1 時間 0.18 ドル、ターン単位のタイムスタンプ(語単位ではない)、25 の評価言語とコードスイッチを記載しています。
Meta AI Developer — Speech to text ↗VentureBeat(2026-09)は 0.18 ドル/時間の料金を報じ、Meta 発表図の Artificial Analysis AA-WER Streaming 最終稿語誤り率 3.1% を引用しています。同図上の他ストリーミングシステムより低い数字です。
VentureBeat — Meta prices Muse Voice Transcribe at $0.18 an hour ↗Gemini 3.5 Transcribe(2026-08-26)は Google の別リリースです。Google が引用する Artificial Analysis はストリーミング WER 4.0%、非ストリーミング WER 2.6%、85+ 言語です。ライブとファイルは別 API です。データ時点は 2026-08。
Google — Gemini 3.5 Transcribe launch(zettel dt-bibigpt-0008) ↗ストリーミング自動音声認識は、ファイルの終わりを待たず、音声が流れている途中で文字にします。部分的な文字 が先に出て、あとから直ることもあります。遅延の設計であり、ブランド名ではありません。
話者分離は録音の「誰がいつ話したか」にラベルを付けます。ターンに話者タグを割り当て、会議録で声を分けます。20人以上というのはタグ集合が大きいという意味であり、全員の名前を知る保証ではありません。
エンドポイント検出は発話の開始と終了を示し、音声アシスタントがいつ聞き終わり、いつ答え始めるかを決めます。これはターン切り替えであり、句読点ではありません。モデルが onset と 終端の印 を出し、停止ボタン待ちではありません。
動画をテキスト化するために、毎日 BibiGPT が選ばれている理由。
全世界 50,000 人以上のユーザーが利用中
“リンクを貼るだけで数秒でクリーンな字幕テキストが手に入り、毎週何時間もの書き起こし作業が不要になりました。”
Maya R.
コンテンツクリエイター · ショート動画を再編集
“文字起こしをエクスポートできるので、動画を何度も止めずに自分のペースで新しい単語を復習できます。”
Daniel K.
語学学習者 · 生の動画で学習
“タイムスタンプ付きの正確なテキストをそのまま引用できます。いつの間にか毎日のワークフローの一部になりました。”
Priya S.
研究者 · 公開講演を引用
よくある質問
ご質問はありますか?お気軽にどうぞ!
1 DeepSeek Harnessに動画要約skillを入れるのはディレクトリをコピーするだけ——SKILL.mdはClaude Codeと同じ。dshを入れなくても、ブラウザにBilibiliやYouTubeのリンクを貼ればタイムスタンプ付きの要約が出ます。
2 2026年に最適なBilibili AI動画要約ツールは?リンクを貼るだけで、30以上のプラットフォームに対応した構造化要約・マインドマップ・要点を即座に取得。上位5ツールを比較します。
3 Bilibili動画から字幕を抽出する最適な方法とは?5つの主要bilibili transcriptツールを比較分析し、BibiGPTがAI文字起こし・翻訳・要約機能でどう差別化されるかを解説します。
YouTube、Bilibili、ポッドキャストのリンクを貼るか、MP3・WAV・M4A をドロップしてください。BibiGPT はタイムスタンプ付き文字起こし、AI 要約、検索できるノートを返します。最終更新:2026-09-07。