Muse Voice Transcribe 解讀——2026-09-01 Meta 上線了什麼

截至 2026-09-07:Meta Superintelligence Labs 於 2026-09-01 發布 Muse Voice Transcribe,以 80ms 分塊做即時串流語音辨識,同一模型覆蓋 20+ 說話人分離和端點偵測。Meta 稱截至 2026-09-01 在 Artificial Analysis 串流語音轉寫榜上排名第一。若你只想把檔案或講座連結轉成文字,用下面的工具即可,不必打開 Meta API 主控台。

發布 · 2026-09-01 80ms 串流語音辨識 下方可試用

Transcribe a file right here

Drop an MP3, WAV, or M4A — BibiGPT returns timestamped text you can copy, without opening Meta Model API.

將 BibiGPT 設為 Google 優先來源 在熱門報導和 AI 總覽裡看到更多 BibiGPT。

關鍵事實(90 秒讀完)

截至 2026-09-07:Meta Superintelligence Labs 於 2026-09-01 發布 Muse Voice Transcribe。這是即時音訊感知模型:80ms 串流語音辨識、20+ 說話人分離、端點偵測,一遍完成。Meta 稱截至 2026-09-01 在 Artificial Analysis 串流語音轉寫榜排名第一。Meta Model API 標價每小時音訊 0.18 美元。最近更新:2026-09-07。

Features

Muse Voice Transcribe 實際是什麼

這是 Meta Superintelligence Labs 的託管即時音訊感知模型,屬於 Muse Spark 家族。它不是 Muse Image。Meta 文件裡的模型 ID 是 muse-voice-transcribe-1.0。

80ms 串流語音辨識(2026-09-01)

音訊按 80ms、12.5 Hz 分塊。模型自己決定是繼續聽還是吐出一個文字片段。Meta 稱之為自適應延遲:用強化學習在「多等一會兒」和「詞更準」之間做權衡。

說話人分離和端點偵測走同一遍

說話人標籤覆蓋 20 人以上。端點標記語音起止。Meta 稱不需要單獨的後處理步驟。這些說法以研究頁為準。

每小時音訊 0.18 美元,僅 API

Meta 語音轉文字文件列出:處理一小時音訊 0.18 美元(每 1000 分鐘 3 美元),串流和檔案上傳同價。沒有開源權重。Mac 上 Meta AI 和 Muse Code 的語音聽寫已經在用這個模型。

如果你要處理長音訊,這意味著什麼

即時語音辨識 API 幫的是在做語音助手的團隊。它替代不了給人類歸檔帶時間戳的文字稿、章節和追問的產品——後者往往只需要貼一條連結。

你不必打開 Model API 主控台

貼上講座或播客連結,或拖入 MP3。要的是能搜尋的文字稿,不是去握 wss://api.meta.ai/v1/asr/realtime 這根 WebSocket。

文字稿是介面,不是成品

串流原文仍要人讀。BibiGPT 吃同一份檔案或連結,回傳章節、帶時間戳的文字稿,以及可以追問的筆記。

這是 Voice Transcribe,不是 Muse Image

Muse Image 是 Meta 另一次 2026 發布。每種意圖各留一個 URL。本頁只覆蓋 09-01 的語音模型。

5 條關鍵變化(90 秒讀完)

來自 Meta 2026-09-01 Muse Voice Transcribe 發布的核心事實。

  1. 1

    2026-09-01 發布,僅託管

    Meta Superintelligence Labs 以 muse-voice-transcribe-1.0 上線。可透過 Meta Model API、Mac 版 Meta AI 和 Muse Code 使用。沒有開源權重。在 Mac 上按住 Fn,即可透過 Meta AI 聽寫。

  2. 2

    80ms 分塊與自適應延遲

    音訊每 80ms(12.5 Hz)變成一個文字單元。模型選擇繼續聽還是輸出文字。自適應延遲用強化學習訓練,把字錯誤獎勵和延遲獎勵相乘,難詞就多等一會兒。

  3. 3

    說話人分離和端點偵測共享辨識遍

    特殊標記說話人切換、說話人標籤 A–Z(20+ 人)、語音 onset 和 endpoint。Meta 稱超過一小時的長音訊也不需要額外後處理流程。

  4. 4

    訓練 70+ 語,驗證 25 語

    首發 Meta 建議先用這 25 種充分驗證的語言,其餘也可試。句內和句間語碼轉換是原生的。語言、關鍵詞和上下文偏置可以提高專名和行話的準確率。

  5. 5

    每小時 0.18 美元,外加一份獨立串流榜

    Meta 文件列出處理一小時音訊 0.18 美元。Meta 稱截至 2026-09-01 在 Artificial Analysis 串流語音轉寫和公開說話人分離榜上排名第一。VentureBeat 引用發布圖:AA-WER Streaming 最終稿字錯誤率 3.1%。

BibiGPT 使用者的 3 個典型場景

即時語音辨識 API 哪裡重要——以及「連結變筆記」產品真正要幹的活在哪。

你在做語音助手

需要 WebSocket 部分結果和模型偵測話輪邊界的團隊,可以評估 Meta Model API。然後再把成品錄音丟進 BibiGPT,讓人拿到章節,而不是一串原始事件。

你只想把課堂錄音轉成文字

九十分鐘講座不需要即時語音辨識通訊端。貼上 URL 或拖入 M4A,匯出帶時間戳的文字稿,繼續追問。這就是產品路徑。

你在追蹤 2026 的語音發布

Muse Voice Transcribe 是 Meta 09-01 的串流語音辨識。Granite Speech 5.0 Turbo CTC 是 IBM 的英語吞吐權重。Gemini 3.5 Transcribe 於 2026-08-26 發布,直播和檔案是不同介面。每個家族各留一個 URL;不要合成一張籠統的「2026 語音辨識」頁。

相關 BibiGPT 工具

與這次發布配套的轉寫與筆記工作流。

來源

發布事實來自 Meta 自家文章。標價和串流榜圖的獨立報導另行標註。

  • 2026-09-01,Meta Superintelligence Labs 發布 Muse Voice Transcribe,作為 Muse Spark 家族首個即時音訊感知模型:80ms 串流語音辨識、20+ 說話人分離、端點偵測、訓練 70+ 語(25 語充分驗證)、原生語碼轉換、原生支援超過一小時長音訊。Meta 稱截至 2026-09-01 在 Artificial Analysis 串流語音轉寫榜排名第一。

    Meta AI Research — Introducing Muse Voice Transcribe ↗
  • Meta 語音轉文字文件列出模型 muse-voice-transcribe-1.0、即時 WebSocket 與檔案 POST 介面、處理一小時音訊 0.18 美元、話輪級時間戳(不是詞級),以及 25 種評測語言與語碼轉換。

    Meta AI Developer — Speech to text ↗
  • VentureBeat(2026-09)報導 0.18 美元/小時標價,並引用 Meta 發布圖:Artificial Analysis AA-WER Streaming 最終稿字錯誤率 3.1%,高於該圖上列出的其他串流系統。

    VentureBeat — Meta prices Muse Voice Transcribe at $0.18 an hour ↗
  • Gemini 3.5 Transcribe(2026-08-26)是 Google 另一次發布:Google 引用的 Artificial Analysis 數字為串流 WER 4.0%、非串流 WER 2.6%,覆蓋 85+ 語言。直播和檔案是不同介面。資料時點 2026-08。

    Google — Gemini 3.5 Transcribe launch(zettel dt-bibigpt-0008) ↗

本頁用到的術語

什麼是串流語音辨識?

串流自動語音辨識在音訊還在進入時就把聲音變成文字,而不是等檔案結束。先出現部分文字,後面可以改。這是延遲設計,不是品牌名。

什麼是說話人分離?

說話人分離給錄音裡「誰在何時說話」打標籤。系統給話輪分配說話人標記,會議稿才能把不同聲音分開。宣稱覆蓋 20 人以上,只說明標籤集合夠大,並不等於認出每個人的名字。

語音辨識裡的端點偵測是什麼?

端點偵測標記一段話的起止,讓語音助手知道何時停止收聽、開始回答。這是話輪切換,不是標點。模型吐出 onset 和 結束標記,而不是等人按停止鍵。

深受創作者、學生和研究人員的喜愛

看看大家為什麼每天都用 BibiGPT 把影片轉成文字。

全球 50,000+ 使用者的信賴之選

★★★★★

“貼上連結幾秒鐘就拿到乾淨的字幕文字,每週幫我省下好幾個小時的手動整理時間。”

Maya R.

內容創作者 · 二次創作短影片

★★★★★

“匯出逐字稿後我可以按自己的節奏複習生詞,再也不用反覆暫停影片了。”

Daniel K.

語言學習者 · 用真實影片學外語

★★★★★

“準確、帶時間戳的文字可以直接引用,它已經悄悄成為我日常工作流程的一部分。”

Priya S.

研究人員 · 引用公開演講

常見問題

歡迎提問!

Popular guides

跳過 API 握手,在這裡語音轉文字

貼上 YouTube、B 站或播客連結——或拖入 MP3、WAV、M4A。BibiGPT 回傳帶時間戳的文字稿、AI 總結,以及能搜尋的筆記。最近更新:2026-09-07。