什麼是串流語音辨識?
串流自動語音辨識在音訊還在進入時就把聲音變成文字,而不是等檔案結束。先出現部分文字,後面可以改。這是延遲設計,不是品牌名。
截至 2026-09-07:Meta Superintelligence Labs 於 2026-09-01 發布 Muse Voice Transcribe,以 80ms 分塊做即時串流語音辨識,同一模型覆蓋 20+ 說話人分離和端點偵測。Meta 稱截至 2026-09-01 在 Artificial Analysis 串流語音轉寫榜上排名第一。若你只想把檔案或講座連結轉成文字,用下面的工具即可,不必打開 Meta API 主控台。
Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without opening Meta Model API.
截至 2026-09-07:Meta Superintelligence Labs 於 2026-09-01 發布 Muse Voice Transcribe。這是即時音訊感知模型:80ms 串流語音辨識、20+ 說話人分離、端點偵測,一遍完成。Meta 稱截至 2026-09-01 在 Artificial Analysis 串流語音轉寫榜排名第一。Meta Model API 標價每小時音訊 0.18 美元。最近更新:2026-09-07。
這是 Meta Superintelligence Labs 的託管即時音訊感知模型,屬於 Muse Spark 家族。它不是 Muse Image。Meta 文件裡的模型 ID 是 muse-voice-transcribe-1.0。
音訊按 80ms、12.5 Hz 分塊。模型自己決定是繼續聽還是吐出一個文字片段。Meta 稱之為自適應延遲:用強化學習在「多等一會兒」和「詞更準」之間做權衡。
說話人標籤覆蓋 20 人以上。端點標記語音起止。Meta 稱不需要單獨的後處理步驟。這些說法以研究頁為準。
Meta 語音轉文字文件列出:處理一小時音訊 0.18 美元(每 1000 分鐘 3 美元),串流和檔案上傳同價。沒有開源權重。Mac 上 Meta AI 和 Muse Code 的語音聽寫已經在用這個模型。
即時語音辨識 API 幫的是在做語音助手的團隊。它替代不了給人類歸檔帶時間戳的文字稿、章節和追問的產品——後者往往只需要貼一條連結。
貼上講座或播客連結,或拖入 MP3。要的是能搜尋的文字稿,不是去握 wss://api.meta.ai/v1/asr/realtime 這根 WebSocket。
串流原文仍要人讀。BibiGPT 吃同一份檔案或連結,回傳章節、帶時間戳的文字稿,以及可以追問的筆記。
Muse Image 是 Meta 另一次 2026 發布。每種意圖各留一個 URL。本頁只覆蓋 09-01 的語音模型。
來自 Meta 2026-09-01 Muse Voice Transcribe 發布的核心事實。
Meta Superintelligence Labs 以 muse-voice-transcribe-1.0 上線。可透過 Meta Model API、Mac 版 Meta AI 和 Muse Code 使用。沒有開源權重。在 Mac 上按住 Fn,即可透過 Meta AI 聽寫。
音訊每 80ms(12.5 Hz)變成一個文字單元。模型選擇繼續聽還是輸出文字。自適應延遲用強化學習訓練,把字錯誤獎勵和延遲獎勵相乘,難詞就多等一會兒。
特殊標記說話人切換、說話人標籤 A–Z(20+ 人)、語音 onset 和 endpoint。Meta 稱超過一小時的長音訊也不需要額外後處理流程。
首發 Meta 建議先用這 25 種充分驗證的語言,其餘也可試。句內和句間語碼轉換是原生的。語言、關鍵詞和上下文偏置可以提高專名和行話的準確率。
Meta 文件列出處理一小時音訊 0.18 美元。Meta 稱截至 2026-09-01 在 Artificial Analysis 串流語音轉寫和公開說話人分離榜上排名第一。VentureBeat 引用發布圖:AA-WER Streaming 最終稿字錯誤率 3.1%。
即時語音辨識 API 哪裡重要——以及「連結變筆記」產品真正要幹的活在哪。
需要 WebSocket 部分結果和模型偵測話輪邊界的團隊,可以評估 Meta Model API。然後再把成品錄音丟進 BibiGPT,讓人拿到章節,而不是一串原始事件。
九十分鐘講座不需要即時語音辨識通訊端。貼上 URL 或拖入 M4A,匯出帶時間戳的文字稿,繼續追問。這就是產品路徑。
Muse Voice Transcribe 是 Meta 09-01 的串流語音辨識。Granite Speech 5.0 Turbo CTC 是 IBM 的英語吞吐權重。Gemini 3.5 Transcribe 於 2026-08-26 發布,直播和檔案是不同介面。每個家族各留一個 URL;不要合成一張籠統的「2026 語音辨識」頁。
與這次發布配套的轉寫與筆記工作流。
發布事實來自 Meta 自家文章。標價和串流榜圖的獨立報導另行標註。
2026-09-01,Meta Superintelligence Labs 發布 Muse Voice Transcribe,作為 Muse Spark 家族首個即時音訊感知模型:80ms 串流語音辨識、20+ 說話人分離、端點偵測、訓練 70+ 語(25 語充分驗證)、原生語碼轉換、原生支援超過一小時長音訊。Meta 稱截至 2026-09-01 在 Artificial Analysis 串流語音轉寫榜排名第一。
Meta AI Research — Introducing Muse Voice Transcribe ↗Meta 語音轉文字文件列出模型 muse-voice-transcribe-1.0、即時 WebSocket 與檔案 POST 介面、處理一小時音訊 0.18 美元、話輪級時間戳(不是詞級),以及 25 種評測語言與語碼轉換。
Meta AI Developer — Speech to text ↗VentureBeat(2026-09)報導 0.18 美元/小時標價,並引用 Meta 發布圖:Artificial Analysis AA-WER Streaming 最終稿字錯誤率 3.1%,高於該圖上列出的其他串流系統。
VentureBeat — Meta prices Muse Voice Transcribe at $0.18 an hour ↗Gemini 3.5 Transcribe(2026-08-26)是 Google 另一次發布:Google 引用的 Artificial Analysis 數字為串流 WER 4.0%、非串流 WER 2.6%,覆蓋 85+ 語言。直播和檔案是不同介面。資料時點 2026-08。
Google — Gemini 3.5 Transcribe launch(zettel dt-bibigpt-0008) ↗串流自動語音辨識在音訊還在進入時就把聲音變成文字,而不是等檔案結束。先出現部分文字,後面可以改。這是延遲設計,不是品牌名。
說話人分離給錄音裡「誰在何時說話」打標籤。系統給話輪分配說話人標記,會議稿才能把不同聲音分開。宣稱覆蓋 20 人以上,只說明標籤集合夠大,並不等於認出每個人的名字。
端點偵測標記一段話的起止,讓語音助手知道何時停止收聽、開始回答。這是話輪切換,不是標點。模型吐出 onset 和 結束標記,而不是等人按停止鍵。
看看大家為什麼每天都用 BibiGPT 把影片轉成文字。
全球 50,000+ 使用者的信賴之選
“貼上連結幾秒鐘就拿到乾淨的字幕文字,每週幫我省下好幾個小時的手動整理時間。”
Maya R.
內容創作者 · 二次創作短影片
“匯出逐字稿後我可以按自己的節奏複習生詞,再也不用反覆暫停影片了。”
Daniel K.
語言學習者 · 用真實影片學外語
“準確、帶時間戳的文字可以直接引用,它已經悄悄成為我日常工作流程的一部分。”
Priya S.
研究人員 · 引用公開演講
FAQ
歡迎提問!
1 Install a video-summary skill into DeepSeek Harness in one copy-paste — SKILL.md matches Claude Code. Or skip dsh: paste a Bilibili or YouTube link in the browser and get a timestamped summary.
2 B站AI影片摘要工具哪個好?BibiGPT支援30+平台、100萬+用戶信賴,一鍵貼上連結即可產生結構化摘要。本文深度對比5大工具,含AI Agent 自動化方案。
3 Extract Bilibili subtitles free: paste a BV/av link for a transcript even with no captions. Compare 5 tools for SRT export and AI summary. No signup to start.
貼上 YouTube、B 站或播客連結——或拖入 MP3、WAV、M4A。BibiGPT 回傳帶時間戳的文字稿、AI 總結,以及能搜尋的筆記。最近更新:2026-09-07。